CommencezCommencez gratuitement

Nettoyer et compter

Retirez les mots vides pour explorer uniquement le contenu des gazouillis d'aviation classés comme plaintes dans twitter_data.

Cette activité fait partie du cours

Introduction à l'analyse de texte en R

Voir le cours

Instructions de l’exercice

  • Tokenisez les gazouillis dans twitter_data. Nommez la colonne contenant les mots tokenisés word.
  • Retirez les mots vides par défaut du twitter_data tokenisé.
  • Filtrez pour ne conserver que les plaintes.
  • Calculez la fréquence des mots à partir du texte tokenisé et nettoyé, puis triez par ordre décroissant du décompte.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
Modifier et exécuter le code