เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

มากกว่าคำ: การตัดคำ (Tokenization) (3)

ft_tokenizer() ใช้วิธีการง่าย ๆ ในการแยกข้อความด้วยช่องว่างเพื่อสร้างคำ สำหรับการใช้งานขั้นสูงกว่านั้น สามารถใช้ regular expressions ในการแยกข้อความได้ โดยทำผ่านฟังก์ชัน ft_regex_tokenizer() ซึ่งมีรูปแบบการใช้งานเหมือนกับ ft_tokenizer() แต่มีอาร์กิวเมนต์เพิ่มเติมคือ pattern สำหรับกำหนดตัวแบ่ง

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

ค่าที่ได้จาก ft_regex_tokenizer() เช่นเดียวกับ ft_tokenizer() จะเป็น list ซ้อน list ของ character vectors

ชุดข้อมูลมีฟิลด์ชื่อ artist_mbid ที่เก็บ ID ของศิลปินบน MusicBrainz ซึ่งเป็นเว็บไซต์สารานุกรม metadata ด้านดนตรี โดย ID จะอยู่ในรูปของตัวเลขฐานสิบหกที่คั่นด้วยขีดกลาง เช่น 65b785d9-499f-48e6-9063-3a1fd1bd488d

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

แนะนำ Spark ด้วย sparklyr ใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เลือกฟิลด์ artist_mbid จาก track_metadata_tbl
  • แยก MusicBrainz ID ออกเป็นกลุ่มตัวเลขฐานสิบหก
    • เรียกใช้ ft_regex_tokenizer()
    • ตั้งชื่อคอลัมน์ผลลัพธ์ว่า artist_mbid_chunks
    • ใช้ขีดกลาง - สำหรับอาร์กิวเมนต์ pattern

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
แก้ไขและรันโค้ด