Больше чем слова: токенизация (3)
Функция ft_tokenizer() использует простой подход: она разбивает текстовые данные на слова по пробелам. Для более сложных случаев можно применять регулярные выражения — это делает функция ft_regex_tokenizer(). Она работает так же, как ft_tokenizer(), но принимает дополнительный аргумент pattern, задающий разделитель.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
Результат ft_regex_tokenizer(), как и ft_tokenizer(), представляет собой список списков символьных векторов.
Набор данных содержит поле artist_mbid с идентификатором исполнителя на MusicBrainz — энциклопедии музыкальных метаданных. Идентификаторы представляют собой шестнадцатеричные числа, разделённые дефисами, например: 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Инструкции к упражнению
- Выберите поле
artist_mbidизtrack_metadata_tbl. - Разбейте идентификаторы MusicBrainz на блоки шестнадцатеричных чисел.
- Вызовите
ft_regex_tokenizer(). - Выходной столбец должен называться
artist_mbid_chunks. - В качестве значения аргумента
patternиспользуйте дефис-.
- Вызовите
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___