CommencezCommencez gratuitement

Mots vides et nuages de mots

Maintenant que vous êtes dans l'état d'esprit de l'exploration de texte, confortablement installé avec un bon verre de chardonnay, allons plus loin. Dans le dernier nuage de mots, « chardonnay » dominait la visualisation. C'était tellement dominant que vous ne pouviez dégager aucun autre constat intéressant.

Modifions la liste des mots vides pour y inclure « chardonnay » afin de voir quels autres mots sont fréquents, mais étaient initialement éclipsés.

Votre espace de travail contient une version nettoyée des gazouillis sur le chardonnay; retirons maintenant certains termes peu informatifs. Cet exercice utilise content() pour vous montrer un gazouillis précis à des fins de comparaison. N'oubliez pas d'utiliser des doubles crochets pour indexer la liste du corpus.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

  • Appliquez content() au 24e document de chardonnay_corp.
  • Ajoutez « chardonnay » aux mots vides anglais et assignez le tout à stops.
  • Examinez les six derniers mots de stops.
  • Créez cleaned_chardonnay_corp avec tm_map() en lui passant chardonnay_corp, la fonction removeWords() et enfin les mots vides, stops.
  • Examinez de nouveau le content du gazouillis 24 pour comparer les résultats.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Review a "cleaned" tweet
___(___)

# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')

# Review last 6 stopwords 
tail(stops)

# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)

# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])
Modifier et exécuter le code