มากกว่าคำ: การตัดคำ (Tokenization) (3)
ft_tokenizer() ใช้วิธีการง่าย ๆ ในการแยกข้อความด้วยช่องว่างเพื่อสร้างคำ สำหรับการใช้งานขั้นสูงกว่านั้น สามารถใช้ regular expressions ในการแยกข้อความได้ โดยทำผ่านฟังก์ชัน ft_regex_tokenizer() ซึ่งมีรูปแบบการใช้งานเหมือนกับ ft_tokenizer() แต่มีอาร์กิวเมนต์เพิ่มเติมคือ pattern สำหรับกำหนดตัวแบ่ง
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
ค่าที่ได้จาก ft_regex_tokenizer() เช่นเดียวกับ ft_tokenizer() จะเป็น list ซ้อน list ของ character vectors
ชุดข้อมูลมีฟิลด์ชื่อ artist_mbid ที่เก็บ ID ของศิลปินบน MusicBrainz ซึ่งเป็นเว็บไซต์สารานุกรม metadata ด้านดนตรี โดย ID จะอยู่ในรูปของตัวเลขฐานสิบหกที่คั่นด้วยขีดกลาง เช่น 65b785d9-499f-48e6-9063-3a1fd1bd488d
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
แนะนำ Spark ด้วย sparklyr ใน R
คำแนะนำการฝึกหัด
- เลือกฟิลด์
artist_mbidจากtrack_metadata_tbl - แยก MusicBrainz ID ออกเป็นกลุ่มตัวเลขฐานสิบหก
- เรียกใช้
ft_regex_tokenizer() - ตั้งชื่อคอลัมน์ผลลัพธ์ว่า
artist_mbid_chunks - ใช้ขีดกลาง
-สำหรับอาร์กิวเมนต์pattern
- เรียกใช้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___