Mer än ord: tokenisering (3)
ft_tokenizer() använder en enkel teknik för att generera ord genom att dela upp textdata vid mellanslag. För mer avancerad användning kan du använda reguljära uttryck för att dela upp textdata. Det görs med funktionen ft_regex_tokenizer(), som fungerar på samma sätt som ft_tokenizer(), men med ett extra pattern-argument för avgränsaren.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
Returvärdet från ft_regex_tokenizer(), precis som från ft_tokenizer(), är en lista av listor med teckenvektorer.
Datamängden innehåller ett fält med namnet artist_mbid som lagrar ett ID för artisten på MusicBrainz – en webbplats som fungerar som en musikmetadataencyklopedi. ID:na har formen av hexadecimala tal separerade med bindestreck, till exempel 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
- Välj fältet
artist_mbidfråntrack_metadata_tbl. - Dela upp MusicBrainz-ID:na i block av hexadecimala tal.
- Anropa
ft_regex_tokenizer(). - Utdatakolumnen ska heta
artist_mbid_chunks. - Använd ett bindestreck,
-, sompattern-argument.
- Anropa
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___