Kelimelerden fazlası: tokenization (3)
ft_tokenizer(), metni boşluklardan bölerek kelimeler üretmek için basit bir teknik kullanır. Daha gelişmiş kullanım için metni düzenli ifadelerle bölebilirsin. Bu, aynı ft_tokenizer() ile aynı kullanıma sahip, ancak ayırıcı için ek bir pattern argümanı olan ft_regex_tokenizer() fonksiyonu ile yapılır.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
ft_regex_tokenizer() fonksiyonunun döndürdüğü değer, ft_tokenizer() gibi, karakter vektörlerinden oluşan listelerin bir listesidir.
Veri kümesinde, MusicBrainz adlı müzik meta verisi ansiklopsisinde sanatçıya ait bir kimlik içeren artist_mbid adlı bir alan bulunur. Bu kimlikler, kısa çizgilerle ayrılmış onaltılık sayılar biçimindedir; örneğin, 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
track_metadata_tbliçindenartist_mbidalanını seç.- MusicBrainz ID'lerini onaltılık sayı parçalarına böl.
ft_regex_tokenizer()çağır.- Çıktı sütununun adı
artist_mbid_chunksolmalı. patternargümanı için kısa çizgi,-, kullan.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___