CommencezCommencez gratuitement

Plus que des mots : la tokenisation (3)

ft_tokenizer() utilise une technique simple pour générer des mots en séparant le texte selon les espaces. Pour des usages plus avancés, vous pouvez utiliser des expressions régulières pour scinder le texte. Cela se fait avec la fonction ft_regex_tokenizer(), qui s'utilise comme ft_tokenizer(), mais avec un argument supplémentaire pattern pour le séparateur.

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

La valeur de retour de ft_regex_tokenizer(), comme pour ft_tokenizer(), est une liste de listes de vecteurs de caractères.

L'ensemble de données contient un champ nommé artist_mbid qui contient un identifiant de l'artiste sur MusicBrainz, un site d'encyclopédie de métadonnées musicales. Les identifiants prennent la forme de nombres hexadécimaux séparés par des traits d'union, par exemple : 65b785d9-499f-48e6-9063-3a1fd1bd488d.

Cette activité fait partie du cours

Introduction à Spark avec sparklyr en R

Voir le cours

Instructions de l’exercice

  • Sélectionnez le champ artist_mbid de track_metadata_tbl.
  • Scindez les identifiants MusicBrainz en blocs de nombres hexadécimaux.
    • Appelez ft_regex_tokenizer().
    • La colonne de sortie doit s'appeler artist_mbid_chunks.
    • Utilisez un trait d'union, -, pour l'argument pattern.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
Modifier et exécuter le code