Retirer les mots vides et les espaces supplémentaires
Un corpus de texte contient généralement de nombreux mots courants comme « a », « an », « the », « of » et « but ». En traitement automatique du langage naturel, on les appelle des mots vides (stop words).
On retire habituellement les mots vides durant le traitement du texte pour se concentrer sur les mots plus importants du corpus et en dégager des insights.
De plus, les espaces supplémentaires créés lors du retrait des caractères spéciaux, de la ponctuation, des nombres et des mots vides doivent être supprimés du corpus.
Le corpus que vous avez créé dans le dernier exercice a été préchargé sous le nom twt_corpus_lwr.
La bibliothèque tm a été préchargée pour cet exercice.
Cette activité fait partie du cours
Analyse des données des médias sociaux avec R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Remove English stop words from the corpus and view the corpus
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)