Začněte nyníZačněte zdarma

Víc než slova: tokenizace (3)

ft_tokenizer() používá jednoduchou techniku – rozděluje textová data na mezery a generuje tak jednotlivá slova. Pro pokročilejší použití můžeš pracovat s regulárními výrazy. K tomu slouží funkce ft_regex_tokenizer(), která funguje stejně jako ft_tokenizer(), ale navíc přijímá argument pattern pro definici oddělovače.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

Návratová hodnota ft_regex_tokenizer() je stejně jako u ft_tokenizer() seznam seznamů znakových vektorů.

Dataset obsahuje pole artist_mbid s identifikátorem umělce na MusicBrainz – encyklopedii hudebních metadat. ID mají podobu hexadecimálních čísel oddělených pomlčkami, například 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

  • Vyber pole artist_mbid z track_metadata_tbl.
  • Rozděl MusicBrainz ID na bloky hexadecimálních čísel.
    • Zavolej ft_regex_tokenizer().
    • Výstupní sloupec pojmenuj artist_mbid_chunks.
    • Jako argument pattern použij pomlčku -.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Upravit a spustit kód