Mai mult decât cuvinte: tokenizare (3)
ft_tokenizer() folosește o tehnică simplă pentru a genera cuvinte, împărțind textul după spații. Pentru utilizări mai avansate, poți folosi expresii regulate pentru a împărți datele text. Acest lucru se realizează prin funcția ft_regex_tokenizer(), care are același mod de utilizare ca ft_tokenizer(), dar cu un argument suplimentar, pattern, pentru separatorul dorit.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
Valoarea returnată de ft_regex_tokenizer(), la fel ca cea a lui ft_tokenizer(), este o listă de liste de vectori de caractere.
Setul de date conține un câmp numit artist_mbid, care include un ID pentru artist pe MusicBrainz – o enciclopedie de metadate muzicale. ID-urile au forma unor numere hexazecimale separate prin cratime, de exemplu 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Acest exercițiu face parte din cursul
Introducere în Spark cu sparklyr în R
Instrucțiuni pentru exercițiu
- Selectează câmpul
artist_mbiddintrack_metadata_tbl. - Împarte ID-urile MusicBrainz în blocuri de numere hexazecimale.
- Apelează
ft_regex_tokenizer(). - Coloana de ieșire ar trebui să se numească
artist_mbid_chunks. - Folosește o cratimă,
-, pentru argumentulpattern.
- Apelează
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___