Kom igångKom igång gratis

Mer än ord: tokenisering (3)

ft_tokenizer() använder en enkel teknik för att generera ord genom att dela upp textdata vid mellanslag. För mer avancerad användning kan du använda reguljära uttryck för att dela upp textdata. Det görs med funktionen ft_regex_tokenizer(), som fungerar på samma sätt som ft_tokenizer(), men med ett extra pattern-argument för avgränsaren.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

Returvärdet från ft_regex_tokenizer(), precis som från ft_tokenizer(), är en lista av listor med teckenvektorer.

Datamängden innehåller ett fält med namnet artist_mbid som lagrar ett ID för artisten på MusicBrainz – en webbplats som fungerar som en musikmetadataencyklopedi. ID:na har formen av hexadecimala tal separerade med bindestreck, till exempel 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

  • Välj fältet artist_mbid från track_metadata_tbl.
  • Dela upp MusicBrainz-ID:na i block av hexadecimala tal.
    • Anropa ft_regex_tokenizer().
    • Utdatakolumnen ska heta artist_mbid_chunks.
    • Använd ett bindestreck, -, som pattern-argument.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Redigera och kör kod