CommencezCommencez gratuitement

Quel est l'effet des bigrammes sur les nuages de mots?

Maintenant que vous avez créé une DTM de bigrammes, vous pouvez l'examiner et refaire un nuage de mots. La nouvelle méthode de découpage en unités (tokenisation) influe non seulement sur les matrices, mais aussi sur toute visualisation ou tout modèle fondé sur ces matrices.

Vous vous souvenez que « Marvin » et « Gaye » étaient des termes séparés dans le nuage de mots sur le chardonnay? Avec les bigrammes, la tokenisation récupère toutes les combinaisons de deux mots. Observez ce qui arrive au nuage de mots dans cet exercice.

Cet exercice utilise str_subset de stringr. Gardez en tête que d'autres cours DataCamp couvrent les expressions rationnelles plus en détail. Rappel : l'expression rationnelle ^ correspond à la position de début dans les bigrammes de l'exercice.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

Les tweets sur le chardonnay ont été nettoyés et organisés en une DTM appelée bigram_dtm.

  • Créez bigram_dtm_m en convertissant bigram_dtm en matrice.
  • Créez un objet freq constitué des fréquences des mots en appliquant colSums() sur bigram_dtm_m.
  • Extrayez le vecteur de caractères des combinaisons de mots avec names(freq) et assignez le résultat à bi_words.
  • Transmettez bi_words à str_subset() avec le motif de correspondance "^marvin" pour examiner tous les bigrammes commençant par « marvin ».
  • Tracez un simple wordcloud() en passant bi_words, freq et max.words = 15 à la fonction.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create bigram_dtm_m
___ <- ___(___)

# Create freq
___ <- ___(___)

# Create bi_words
___ <- ___(___)

# Examine part of bi_words
___(___, ___)

# Plot a word cloud
___(___, ___, ___)
Modifier et exécuter le code