Nettoyer et compter
Retirez les mots vides pour explorer uniquement le contenu des gazouillis d'aviation classés comme plaintes dans twitter_data.
Cette activité fait partie du cours
Introduction à l'analyse de texte en R
Instructions de l’exercice
- Tokenisez les gazouillis dans
twitter_data. Nommez la colonne contenant les mots tokenisésword. - Retirez les mots vides par défaut du
twitter_datatokenisé. - Filtrez pour ne conserver que les plaintes.
- Calculez la fréquence des mots à partir du texte tokenisé et nettoyé, puis triez par ordre décroissant du décompte.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)