Mots vides et nuages de mots
Maintenant que vous êtes dans l'état d'esprit de l'exploration de texte, confortablement installé avec un bon verre de chardonnay, allons plus loin. Dans le dernier nuage de mots, « chardonnay » dominait la visualisation. C'était tellement dominant que vous ne pouviez dégager aucun autre constat intéressant.
Modifions la liste des mots vides pour y inclure « chardonnay » afin de voir quels autres mots sont fréquents, mais étaient initialement éclipsés.
Votre espace de travail contient une version nettoyée des gazouillis sur le chardonnay; retirons maintenant certains termes peu informatifs. Cet exercice utilise content() pour vous montrer un gazouillis précis à des fins de comparaison. N'oubliez pas d'utiliser des doubles crochets pour indexer la liste du corpus.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
- Appliquez
content()au 24e document dechardonnay_corp. - Ajoutez « chardonnay » aux mots vides anglais et assignez le tout à
stops. - Examinez les six derniers mots de
stops. - Créez
cleaned_chardonnay_corpavectm_map()en lui passantchardonnay_corp, la fonctionremoveWords()et enfin les mots vides,stops. - Examinez de nouveau le
contentdu gazouillis24pour comparer les résultats.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Review a "cleaned" tweet
___(___)
# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')
# Review last 6 stopwords
tail(stops)
# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)
# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])