НачатьНачать бесплатно

Больше чем слова: токенизация (3)

Функция ft_tokenizer() использует простой подход: она разбивает текстовые данные на слова по пробелам. Для более сложных случаев можно применять регулярные выражения — это делает функция ft_regex_tokenizer(). Она работает так же, как ft_tokenizer(), но принимает дополнительный аргумент pattern, задающий разделитель.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

Результат ft_regex_tokenizer(), как и ft_tokenizer(), представляет собой список списков символьных векторов.

Набор данных содержит поле artist_mbid с идентификатором исполнителя на MusicBrainz — энциклопедии музыкальных метаданных. Идентификаторы представляют собой шестнадцатеричные числа, разделённые дефисами, например: 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

  • Выберите поле artist_mbid из track_metadata_tbl.
  • Разбейте идентификаторы MusicBrainz на блоки шестнадцатеричных чисел.
    • Вызовите ft_regex_tokenizer().
    • Выходной столбец должен называться artist_mbid_chunks.
    • В качестве значения аргумента pattern используйте дефис -.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Редактировать и запускать код