Rappel sur TM (I)
Dans le cours Text Mining: Bag of Words, vous avez appris qu'un corpus est un ensemble de textes, et vous avez étudié quelques fonctions de prétraitement du texte. Pour résumer, une façon de créer et nettoyer un corpus est d'utiliser les fonctions ci‑dessous. Même si ce cours est différent, l'analyse de sentiment fait partie de l'exploration de texte, donc un rappel peut être utile.
- Transformez un vecteur de caractères en source de texte avec
VectorSource(). - Transformez une source de texte en corpus avec
VCorpus(). - Retirez les caractères indésirables du corpus à l'aide de fonctions de nettoyage comme
removePunctuation()etstripWhitespace()detm, ainsi quereplace_abbreviation()deqdap.
Dans cet exercice, une fonction personnalisée clean_corpus() a été créée à partir de fonctions de prétraitement standard pour en faciliter l'application.
clean_corpus() accepte la sortie de VCorpus() et applique des fonctions de nettoyage. Par exemple :
processed_corpus <- clean_corpus(my_corpus)
Cette activité fait partie du cours
Analyse de sentiment en R
Instructions de l’exercice
Votre session R contient un vecteur de texte, tm_define, avec deux petits documents, ainsi que la fonction clean_corpus().
- Créez un objet nommé
tm_vectoren appliquantVectorSource()àtm_define. - Créez
tm_corpusen utilisantVCorpus()surtm_vector. - Utilisez
content()pour examiner le contenu du premier document danstm_corpus.- Les documents du corpus sont accessibles avec la syntaxe de liste, donc utilisez des doubles crochets, p. ex.
[[1]].
- Les documents du corpus sont accessibles avec la syntaxe de liste, donc utilisez des doubles crochets, p. ex.
- Nettoyez le texte du corpus avec la fonction personnalisée
clean_corpus()appliquée àtm_corpus. Nommez ce nouvel objettm_clean. - Examinez de nouveau le premier document du nouvel objet
tm_cleanpour voir comment le texte a changé après l'application declean_corpus().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___