Plus que des mots : la tokenisation (3)
ft_tokenizer() utilise une technique simple pour générer des mots en séparant le texte selon les espaces. Pour des usages plus avancés, vous pouvez utiliser des expressions régulières pour scinder le texte. Cela se fait avec la fonction ft_regex_tokenizer(), qui s'utilise comme ft_tokenizer(), mais avec un argument supplémentaire pattern pour le séparateur.
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
La valeur de retour de ft_regex_tokenizer(), comme pour ft_tokenizer(), est une liste de listes de vecteurs de caractères.
L'ensemble de données contient un champ nommé artist_mbid qui contient un identifiant de l'artiste sur MusicBrainz, un site d'encyclopédie de métadonnées musicales. Les identifiants prennent la forme de nombres hexadécimaux séparés par des traits d'union, par exemple : 65b785d9-499f-48e6-9063-3a1fd1bd488d.
Cette activité fait partie du cours
Introduction à Spark avec sparklyr en R
Instructions de l’exercice
- Sélectionnez le champ
artist_mbiddetrack_metadata_tbl. - Scindez les identifiants MusicBrainz en blocs de nombres hexadécimaux.
- Appelez
ft_regex_tokenizer(). - La colonne de sortie doit s'appeler
artist_mbid_chunks. - Utilisez un trait d'union,
-, pour l'argumentpattern.
- Appelez
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___