Meer dan woorden: tokenization (3)
ft_tokenizer() gebruikt een eenvoudige techniek om woorden te genereren door tekst op spaties te splitsen. Voor geavanceerder gebruik kun je reguliere expressies inzetten om de tekst te splitsen. Dit doe je met de functie ft_regex_tokenizer(), die hetzelfde werkt als ft_tokenizer(), maar met een extra argument pattern voor de scheidingstekens.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
De returnwaarde van ft_regex_tokenizer() is, net als bij ft_tokenizer(), een lijst van lijsten met tekenreeksen.
De gegevensset bevat een veld artist_mbid met een ID voor de artiest op MusicBrainz, een website met muziekmetadata. De ID’s hebben de vorm van hexadecimale getallen gescheiden door koppeltekens, bijvoorbeeld 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
- Selecteer het veld
artist_mbiduittrack_metadata_tbl. - Splits de MusicBrainz-ID’s in stukken met hexadecimale getallen.
- Roep
ft_regex_tokenizer()aan. - Noem de outputkolom
artist_mbid_chunks. - Gebruik een koppelteken,
-, voor het argumentpattern.
- Roep
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___