Supprimer les mots vides et les espaces supplémentaires
Un corpus de textes contient généralement de nombreux mots courants comme « a », « an », « the », « of » et « but ». En traitement automatique du langage, on les appelle des mots vides (stop words).
On supprime généralement ces mots lors du prétraitement pour se concentrer sur les termes les plus pertinents du corpus et en tirer des enseignements.
De plus, les espaces supplémentaires créés lors de la suppression des caractères spéciaux, de la ponctuation, des nombres et des mots vides doivent aussi être supprimés du corpus.
Le corpus que vous avez créé dans l’exercice précédent a été préchargé sous le nom twt_corpus_lwr.
La bibliothèque tm a été préchargée pour cet exercice.
Cet exercice fait partie du cours
<cours>Analyzing Social Media Data in R</cours>Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Remove English stop words from the corpus and view the corpus
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)