Lebih dari sekadar kata: tokenisasi (3)
ft_tokenizer() menggunakan teknik sederhana untuk menghasilkan kata dengan memecah data teks berdasarkan spasi. Untuk penggunaan yang lebih maju, Anda dapat menggunakan regular expression untuk memecah data teks. Hal ini dilakukan melalui fungsi ft_regex_tokenizer(), yang penggunaannya sama dengan ft_tokenizer(), tetapi dengan argumen tambahan pattern untuk pemisah.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
Nilai keluaran dari ft_regex_tokenizer(), seperti halnya ft_tokenizer(), adalah daftar berisi daftar vektor karakter.
Himpunan data ini memiliki kolom bernama artist_mbid yang berisi ID artis pada MusicBrainz, sebuah ensiklopedia metadata musik. ID tersebut berupa angka heksadesimal yang dipisahkan tanda hubung, misalnya 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Latihan ini merupakan bagian dari kursus
Pengantar Spark dengan sparklyr di R
Instruksi latihan
- Pilih kolom
artist_mbiddaritrack_metadata_tbl. - Pecah ID MusicBrainz menjadi potongan-potongan angka heksadesimal.
- Panggil
ft_regex_tokenizer(). - Kolom keluaran harus bernama
artist_mbid_chunks. - Gunakan tanda hubung,
-, untuk argumenpattern.
- Panggil
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___