Aan de slagBegin gratis

Meer dan woorden: tokenization (3)

ft_tokenizer() gebruikt een eenvoudige techniek om woorden te genereren door tekst op spaties te splitsen. Voor geavanceerder gebruik kun je reguliere expressies inzetten om de tekst te splitsen. Dit doe je met de functie ft_regex_tokenizer(), die hetzelfde werkt als ft_tokenizer(), maar met een extra argument pattern voor de scheidingstekens.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

De returnwaarde van ft_regex_tokenizer() is, net als bij ft_tokenizer(), een lijst van lijsten met tekenreeksen.

De gegevensset bevat een veld artist_mbid met een ID voor de artiest op MusicBrainz, een website met muziekmetadata. De ID’s hebben de vorm van hexadecimale getallen gescheiden door koppeltekens, bijvoorbeeld 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

  • Selecteer het veld artist_mbid uit track_metadata_tbl.
  • Splits de MusicBrainz-ID’s in stukken met hexadecimale getallen.
    • Roep ft_regex_tokenizer() aan.
    • Noem de outputkolom artist_mbid_chunks.
    • Gebruik een koppelteken, -, voor het argument pattern.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Code bewerken en uitvoeren