Mulai sekarangMulai gratis

Lebih dari sekadar kata: tokenisasi (3)

ft_tokenizer() menggunakan teknik sederhana untuk menghasilkan kata dengan memecah data teks berdasarkan spasi. Untuk penggunaan yang lebih maju, Anda dapat menggunakan regular expression untuk memecah data teks. Hal ini dilakukan melalui fungsi ft_regex_tokenizer(), yang penggunaannya sama dengan ft_tokenizer(), tetapi dengan argumen tambahan pattern untuk pemisah.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

Nilai keluaran dari ft_regex_tokenizer(), seperti halnya ft_tokenizer(), adalah daftar berisi daftar vektor karakter.

Himpunan data ini memiliki kolom bernama artist_mbid yang berisi ID artis pada MusicBrainz, sebuah ensiklopedia metadata musik. ID tersebut berupa angka heksadesimal yang dipisahkan tanda hubung, misalnya 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Latihan ini merupakan bagian dari kursus

Pengantar Spark dengan sparklyr di R

Lihat Kursus

Instruksi latihan

  • Pilih kolom artist_mbid dari track_metadata_tbl.
  • Pecah ID MusicBrainz menjadi potongan-potongan angka heksadesimal.
    • Panggil ft_regex_tokenizer().
    • Kolom keluaran harus bernama artist_mbid_chunks.
    • Gunakan tanda hubung, -, untuk argumen pattern.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Edit dan Jalankan Kode