Fonctions de nettoyage courantes de tm
Maintenant que vous connaissez deux façons de créer un corpus, vous pouvez vous concentrer sur le nettoyage, ou le prétraitement, du texte. Vous commencerez par nettoyer un petit extrait de texte, puis vous passerez à des corpus plus grands.
Dans l'exploration de textes avec bag of words, le nettoyage aide à regrouper les termes. Par exemple, il peut être logique de considérer que « miner », « mining » et « mine » correspondent à un seul terme. Les étapes de prétraitement spécifiques varient selon le projet. Par exemple, les mots employés dans des tweets sont très différents de ceux des documents juridiques; le processus de nettoyage peut donc aussi être très différent.
Parmi les fonctions de prétraitement courantes, on retrouve :
tolower(): Mettre tous les caractères en minusculesremovePunctuation(): Retirer tous les signes de ponctuationremoveNumbers(): Retirer les nombresstripWhitespace(): Retirer les espaces superflus
tolower() fait partie de R de base, tandis que les trois autres fonctions proviennent du paquet tm. Pour la suite, nous chargerons tm et qdap pour vous lorsqu'ils seront nécessaires. Chaque fois que nous présenterons un nouveau paquet, vous le chargerez vous-même la première fois.
La variable text, qui contient une phrase, est affichée dans le script.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
Appliquez chacune des fonctions suivantes à text, en affichant simplement les résultats dans la console :
- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create the object: text
text <- "She woke up at 6 A.M. It\'s so early! She was only 10% awake and began drinking coffee in front of her computer."
# Make lowercase
___
# Remove punctuation
____
# Remove numbers
___
# Remove whitespace
___