Più delle parole: tokenizzazione (3)
ft_tokenizer() usa una tecnica semplice per generare parole dividendo il testo sugli spazi. Per usi più avanzati, puoi utilizzare le espressioni regolari per suddividere il testo. Questo si fa con la funzione ft_regex_tokenizer, che ha lo stesso utilizzo di ft_tokenizer(), ma con un argomento aggiuntivo pattern per specificare il separatore.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
Il valore restituito da ft_regex_tokenizer(), come per ft_tokenizer(), è un elenco di elenchi di vettori di caratteri.
Il dataset contiene un campo chiamato artist_mbid che contiene un ID per l’artista su MusicBrainz, un’enciclopedia online di metadati musicali. Gli ID hanno la forma di numeri esadecimali separati da trattini, ad esempio 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
- Seleziona il campo
artist_mbiddatrack_metadata_tbl. - Suddividi gli ID di MusicBrainz in blocchi di numeri esadecimali.
- Chiama
ft_regex_tokenizer(). - La colonna di output deve chiamarsi
artist_mbid_chunks. - Usa un trattino,
-, per l’argomentopattern.
- Chiama
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___