Rappel TM (I)
Dans le cours Text Mining: Bag of Words, vous avez appris qu'un corpus est un ensemble de textes, et vous avez étudié des fonctions de prétraitement du texte. Pour récapituler, une façon de créer et nettoyer un corpus consiste à utiliser les fonctions ci-dessous. Même si ce cours est différent, l'analyse de sentiments fait partie du text mining ; un petit rappel peut donc être utile.
- Transformez un vecteur de caractères en source de texte avec
VectorSource(). - Transformez une source de texte en corpus avec
VCorpus(). - Supprimez les caractères indésirables du corpus à l'aide de fonctions de nettoyage comme
removePunctuation()etstripWhitespace()detm, etreplace_abbreviation()deqdap.
Dans cet exercice, une fonction personnalisée clean_corpus() a été créée à partir de fonctions de prétraitement standard pour en faciliter l'usage.
clean_corpus() accepte la sortie de VCorpus() et applique des fonctions de nettoyage. Par exemple :
processed_corpus <- clean_corpus(my_corpus)
Cet exercice fait partie du cours
<cours>Analyse de sentiments en R</cours>Instructions de l’exercice
Votre session R contient un vecteur de texte, tm_define, avec deux petits documents, ainsi que la fonction clean_corpus().
- Créez un objet appelé
tm_vectoren appliquantVectorSource()àtm_define. - Créez
tm_corpusen utilisantVCorpus()surtm_vector. - Utilisez
content()pour examiner le contenu du premier document detm_corpus.- Les documents du corpus sont accessibles avec la syntaxe des listes ; utilisez donc des doubles crochets, par exemple
[[1]].
- Les documents du corpus sont accessibles avec la syntaxe des listes ; utilisez donc des doubles crochets, par exemple
- Nettoyez le texte du corpus en appliquant la fonction personnalisée
clean_corpus()àtm_corpus. Nommez ce nouvel objettm_clean. - Examinez à nouveau le premier document du nouvel objet
tm_cleanpour voir comment le texte a changé après l'application declean_corpus().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___