Inizia subitoInizia gratis

Più delle parole: tokenizzazione (3)

ft_tokenizer() usa una tecnica semplice per generare parole dividendo il testo sugli spazi. Per usi più avanzati, puoi utilizzare le espressioni regolari per suddividere il testo. Questo si fa con la funzione ft_regex_tokenizer, che ha lo stesso utilizzo di ft_tokenizer(), ma con un argomento aggiuntivo pattern per specificare il separatore.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

Il valore restituito da ft_regex_tokenizer(), come per ft_tokenizer(), è un elenco di elenchi di vettori di caratteri.

Il dataset contiene un campo chiamato artist_mbid che contiene un ID per l’artista su MusicBrainz, un’enciclopedia online di metadati musicali. Gli ID hanno la forma di numeri esadecimali separati da trattini, ad esempio 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Questo esercizio fa parte del corso

Introduzione a Spark con sparklyr in R

Visualizza corso

Istruzioni dell'esercizio

  • Seleziona il campo artist_mbid da track_metadata_tbl.
  • Suddividi gli ID di MusicBrainz in blocchi di numeri esadecimali.
    • Chiama ft_regex_tokenizer().
    • La colonna di output deve chiamarsi artist_mbid_chunks.
    • Usa un trattino, -, per l’argomento pattern.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Modifica ed esegui il codice