Quel est l'effet des bigrammes sur les nuages de mots?
Maintenant que vous avez créé une DTM de bigrammes, vous pouvez l'examiner et refaire un nuage de mots. La nouvelle méthode de découpage en unités (tokenisation) influe non seulement sur les matrices, mais aussi sur toute visualisation ou tout modèle fondé sur ces matrices.
Vous vous souvenez que « Marvin » et « Gaye » étaient des termes séparés dans le nuage de mots sur le chardonnay? Avec les bigrammes, la tokenisation récupère toutes les combinaisons de deux mots. Observez ce qui arrive au nuage de mots dans cet exercice.
Cet exercice utilise str_subset de stringr. Gardez en tête que d'autres cours DataCamp couvrent les expressions rationnelles plus en détail. Rappel : l'expression rationnelle ^ correspond à la position de début dans les bigrammes de l'exercice.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
Les tweets sur le chardonnay ont été nettoyés et organisés en une DTM appelée bigram_dtm.
- Créez
bigram_dtm_men convertissantbigram_dtmen matrice. - Créez un objet
freqconstitué des fréquences des mots en appliquantcolSums()surbigram_dtm_m. - Extrayez le vecteur de caractères des combinaisons de mots avec
names(freq)et assignez le résultat àbi_words. - Transmettez
bi_wordsàstr_subset()avec le motif de correspondance"^marvin"pour examiner tous les bigrammes commençant par « marvin ». - Tracez un simple
wordcloud()en passantbi_words,freqetmax.words = 15à la fonction.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create bigram_dtm_m
___ <- ___(___)
# Create freq
___ <- ___(___)
# Create bi_words
___ <- ___(___)
# Examine part of bi_words
___(___, ___)
# Plot a word cloud
___(___, ___, ___)