CommencerCommencez gratuitement

Supprimer les mots vides et les espaces supplémentaires

Un corpus de textes contient généralement de nombreux mots courants comme « a », « an », « the », « of » et « but ». En traitement automatique du langage, on les appelle des mots vides (stop words).

On supprime généralement ces mots lors du prétraitement pour se concentrer sur les termes les plus pertinents du corpus et en tirer des enseignements.

De plus, les espaces supplémentaires créés lors de la suppression des caractères spéciaux, de la ponctuation, des nombres et des mots vides doivent aussi être supprimés du corpus.

Le corpus que vous avez créé dans l’exercice précédent a été préchargé sous le nom twt_corpus_lwr.

La bibliothèque tm a été préchargée pour cet exercice.

Cet exercice fait partie du cours

<cours>Analyzing Social Media Data in R</cours>
Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Remove English stop words from the corpus and view the corpus 
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)
Modifier et exécuter le code