CommencezCommencez gratuitement

Tout sur les mots vides

Il existe souvent des mots fréquents qui apportent peu d'information. On les appelle des mots vides, et vous voudrez peut-être les retirer de votre analyse. Parmi les mots vides courants en anglais, on retrouve « I », « she'll », « the », etc. Dans le paquet tm, on compte 174 mots vides anglais courants (vous allez les afficher dans cet exercice!).

Lors de vos analyses, vous devrez probablement ajouter à cette liste. Dans notre exemple de gazouillis sur le café, tous les tweets contiennent « coffee », donc il est important de retirer ce mot en plus des mots vides usuels. Laisser « coffee » ne fournit aucun éclairage et entraînera une surestimation dans une analyse de fréquence.

L'utilisation de la fonction c() vous permet d'ajouter de nouveaux mots à la liste des mots vides. Par exemple, ce qui suit ajoute « word1 » et « word2 » à la liste anglaise par défaut des mots vides :

all_stops <- c("word1", "word2", stopwords("en"))

Une fois que vous avez une liste de mots vides pertinente, utilisez la fonction removeWords() sur votre texte. removeWords() prend deux arguments : l'objet text auquel elle s'applique et la liste des mots à retirer.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

  • Passez en revue les mots vides standards en appelant stopwords("en").
  • Retirez les mots vides « en » de text.
  • Ajoutez « coffee » et « bean » aux mots vides standards et assignez le tout à new_stops.
  • Retirez les mots vides personnalisés, new_stops, de text.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

## text is preloaded into your workspace

# List standard English stop words
___

# Print text without standard stop words
removeWords(___, ___("___"))

# Add "coffee" and "bean" to the list: new_stops
new_stops <- c("___", "___", ___)

# Remove stop words from text
___
Modifier et exécuter le code