ÎncepețiÎncepe gratuit

Mai mult decât cuvinte: tokenizare (3)

ft_tokenizer() folosește o tehnică simplă pentru a genera cuvinte, împărțind textul după spații. Pentru utilizări mai avansate, poți folosi expresii regulate pentru a împărți datele text. Acest lucru se realizează prin funcția ft_regex_tokenizer(), care are același mod de utilizare ca ft_tokenizer(), dar cu un argument suplimentar, pattern, pentru separatorul dorit.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

Valoarea returnată de ft_regex_tokenizer(), la fel ca cea a lui ft_tokenizer(), este o listă de liste de vectori de caractere.

Setul de date conține un câmp numit artist_mbid, care include un ID pentru artist pe MusicBrainz – o enciclopedie de metadate muzicale. ID-urile au forma unor numere hexazecimale separate prin cratime, de exemplu 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Acest exercițiu face parte din cursul

Introducere în Spark cu sparklyr în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Selectează câmpul artist_mbid din track_metadata_tbl.
  • Împarte ID-urile MusicBrainz în blocuri de numere hexazecimale.
    • Apelează ft_regex_tokenizer().
    • Coloana de ieșire ar trebui să se numească artist_mbid_chunks.
    • Folosește o cratimă, -, pentru argumentul pattern.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Editează și rulează codul