Víc než slova: tokenizace (3)
ft_tokenizer() používá jednoduchou techniku – rozděluje textová data na mezery a generuje tak jednotlivá slova. Pro pokročilejší použití můžeš pracovat s regulárními výrazy. K tomu slouží funkce ft_regex_tokenizer(), která funguje stejně jako ft_tokenizer(), ale navíc přijímá argument pattern pro definici oddělovače.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
Návratová hodnota ft_regex_tokenizer() je stejně jako u ft_tokenizer() seznam seznamů znakových vektorů.
Dataset obsahuje pole artist_mbid s identifikátorem umělce na MusicBrainz – encyklopedii hudebních metadat. ID mají podobu hexadecimálních čísel oddělených pomlčkami, například 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
- Vyber pole
artist_mbidztrack_metadata_tbl. - Rozděl MusicBrainz ID na bloky hexadecimálních čísel.
- Zavolej
ft_regex_tokenizer(). - Výstupní sloupec pojmenuj
artist_mbid_chunks. - Jako argument
patternpoužij pomlčku-.
- Zavolej
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___