Bắt đầu ngayBắt đầu miễn phí

Hơn cả từ ngữ: tokenization (3)

ft_tokenizer() dùng một kỹ thuật đơn giản để tạo từ bằng cách tách dữ liệu văn bản theo dấu cách. Với các trường hợp nâng cao hơn, bạn có thể dùng biểu thức chính quy để tách văn bản. Việc này được thực hiện qua hàm ft_regex_tokenizer(), có cách dùng giống ft_tokenizer() nhưng có thêm đối số pattern để chỉ định ký tự tách.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

Giá trị trả về từ ft_regex_tokenizer(), cũng như ft_tokenizer(), là một danh sách các danh sách vector ký tự.

Bộ dữ liệu có một trường tên artist_mbid chứa ID của nghệ sĩ trên MusicBrainz, một bách khoa toàn thư về siêu dữ liệu âm nhạc. Các ID có dạng số hệ thập lục phân được phân tách bằng dấu gạch nối, ví dụ: 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Bài tập này là một phần của khóa học

Nhập môn Spark với sparklyr trong R

Xem khóa học

Hướng dẫn bài tập

  • Chọn trường artist_mbid từ track_metadata_tbl.
  • Tách các MusicBrainz ID thành các phần là các số thập lục phân.
    • Gọi ft_regex_tokenizer().
    • Cột đầu ra đặt tên là artist_mbid_chunks.
    • Dùng dấu gạch nối, -, cho đối số pattern.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Chỉnh sửa và Chạy Mã