CommencezCommencez gratuitement

Retirer les mots vides et les espaces supplémentaires

Un corpus de texte contient généralement de nombreux mots courants comme « a », « an », « the », « of » et « but ». En traitement automatique du langage naturel, on les appelle des mots vides (stop words).

On retire habituellement les mots vides durant le traitement du texte pour se concentrer sur les mots plus importants du corpus et en dégager des insights.

De plus, les espaces supplémentaires créés lors du retrait des caractères spéciaux, de la ponctuation, des nombres et des mots vides doivent être supprimés du corpus.

Le corpus que vous avez créé dans le dernier exercice a été préchargé sous le nom twt_corpus_lwr.

La bibliothèque tm a été préchargée pour cet exercice.

Cette activité fait partie du cours

Analyse des données des médias sociaux avec R

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Remove English stop words from the corpus and view the corpus 
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)
Modifier et exécuter le code