Tout sur les mots vides
Il existe souvent des mots fréquents qui apportent peu d'information. On les appelle des mots vides, et vous voudrez peut-être les retirer de votre analyse. Parmi les mots vides courants en anglais, on retrouve « I », « she'll », « the », etc. Dans le paquet tm, on compte 174 mots vides anglais courants (vous allez les afficher dans cet exercice!).
Lors de vos analyses, vous devrez probablement ajouter à cette liste. Dans notre exemple de gazouillis sur le café, tous les tweets contiennent « coffee », donc il est important de retirer ce mot en plus des mots vides usuels. Laisser « coffee » ne fournit aucun éclairage et entraînera une surestimation dans une analyse de fréquence.
L'utilisation de la fonction c() vous permet d'ajouter de nouveaux mots à la liste des mots vides. Par exemple, ce qui suit ajoute « word1 » et « word2 » à la liste anglaise par défaut des mots vides :
all_stops <- c("word1", "word2", stopwords("en"))
Une fois que vous avez une liste de mots vides pertinente, utilisez la fonction removeWords() sur votre texte. removeWords() prend deux arguments : l'objet text auquel elle s'applique et la liste des mots à retirer.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
- Passez en revue les mots vides standards en appelant
stopwords("en"). - Retirez les mots vides « en » de
text. - Ajoutez « coffee » et « bean » aux mots vides standards et assignez le tout à
new_stops. - Retirez les mots vides personnalisés,
new_stops, detext.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
## text is preloaded into your workspace
# List standard English stop words
___
# Print text without standard stop words
removeWords(___, ___("___"))
# Add "coffee" and "bean" to the list: new_stops
new_stops <- c("___", "___", ___)
# Remove stop words from text
___