Un nuage de mots simple
Rendu ici, vous avez bu bien trop de café. Et voir les mots les plus fréquents comme « shop », « morning » et « drinking », entre autres, n'a rien de très révélateur.
Pour souligner vos progrès, essayons un autre lot de 1000 tweets. Pour l'instant, vous ne saurez pas ce qu'ils ont en commun, mais voyons si vous pouvez le deviner à l'aide d'un nuage de mots. Les valeurs de fréquence des termes des tweets sont déjà chargées dans votre espace de travail.
Un nuage de mots est une visualisation des termes. Dans un nuage de mots, la taille est souvent proportionnelle à la fréquence et, dans certains cas, les couleurs peuvent indiquer une autre mesure. Pour le moment, on reste simple : la taille est liée à la fréquence de chaque mot, et nous choisissons une seule couleur.
Comme vous l'avez vu dans la vidéo, la fonction wordcloud() s'utilise ainsi :
wordcloud(words, frequencies, max.words = 500, colors = "blue")
Les analyses en fouille de texte incluent souvent des nuages de mots simples. En fait, ils sont probablement trop utilisés, mais ils peuvent quand même aider à saisir rapidement un corpus de texte !
term_frequency est chargé dans votre espace de travail.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
- Chargez le paquet
wordcloud. - Affichez les 10 premières entrées de
term_frequency. - Extrayez les termes en appliquant
names()àterm_frequency. Nommez le vecteur de chaînesterms_vec. - Créez un
wordcloud()en utilisantterms_vecpour les mots etterm_frequencypour les valeurs. Ajoutez les paramètresmax.words = 50etcolors = "red".
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load wordcloud package
# Print the first 10 entries in term_frequency
# Vector of terms
# Create a word cloud for the values in word_freqs