Hơn cả từ ngữ: tokenization (3)
ft_tokenizer() dùng một kỹ thuật đơn giản để tạo từ bằng cách tách dữ liệu văn bản theo dấu cách. Với các trường hợp nâng cao hơn, bạn có thể dùng biểu thức chính quy để tách văn bản. Việc này được thực hiện qua hàm ft_regex_tokenizer(), có cách dùng giống ft_tokenizer() nhưng có thêm đối số pattern để chỉ định ký tự tách.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
Giá trị trả về từ ft_regex_tokenizer(), cũng như ft_tokenizer(), là một danh sách các danh sách vector ký tự.
Bộ dữ liệu có một trường tên artist_mbid chứa ID của nghệ sĩ trên MusicBrainz, một bách khoa toàn thư về siêu dữ liệu âm nhạc. Các ID có dạng số hệ thập lục phân được phân tách bằng dấu gạch nối, ví dụ: 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Bài tập này là một phần của khóa học
Nhập môn Spark với sparklyr trong R
Hướng dẫn bài tập
- Chọn trường
artist_mbidtừtrack_metadata_tbl. - Tách các MusicBrainz ID thành các phần là các số thập lục phân.
- Gọi
ft_regex_tokenizer(). - Cột đầu ra đặt tên là
artist_mbid_chunks. - Dùng dấu gạch nối,
-, cho đối sốpattern.
- Gọi
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___