BaşlayınÜcretsiz başlayın

Kelimelerden fazlası: tokenization (3)

ft_tokenizer(), metni boşluklardan bölerek kelimeler üretmek için basit bir teknik kullanır. Daha gelişmiş kullanım için metni düzenli ifadelerle bölebilirsin. Bu, aynı ft_tokenizer() ile aynı kullanıma sahip, ancak ayırıcı için ek bir pattern argümanı olan ft_regex_tokenizer() fonksiyonu ile yapılır.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

ft_regex_tokenizer() fonksiyonunun döndürdüğü değer, ft_tokenizer() gibi, karakter vektörlerinden oluşan listelerin bir listesidir.

Veri kümesinde, MusicBrainz adlı müzik meta verisi ansiklopsisinde sanatçıya ait bir kimlik içeren artist_mbid adlı bir alan bulunur. Bu kimlikler, kısa çizgilerle ayrılmış onaltılık sayılar biçimindedir; örneğin, 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

  • track_metadata_tbl içinden artist_mbid alanını seç.
  • MusicBrainz ID'lerini onaltılık sayı parçalarına böl.
    • ft_regex_tokenizer() çağır.
    • Çıktı sütununun adı artist_mbid_chunks olmalı.
    • pattern argümanı için kısa çizgi, -, kullan.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Kodu Düzenle ve Çalıştır