CommencezCommencez gratuitement

Rappel sur TM (I)

Dans le cours Text Mining: Bag of Words, vous avez appris qu'un corpus est un ensemble de textes, et vous avez étudié quelques fonctions de prétraitement du texte. Pour résumer, une façon de créer et nettoyer un corpus est d'utiliser les fonctions ci‑dessous. Même si ce cours est différent, l'analyse de sentiment fait partie de l'exploration de texte, donc un rappel peut être utile.

Dans cet exercice, une fonction personnalisée clean_corpus() a été créée à partir de fonctions de prétraitement standard pour en faciliter l'application.

clean_corpus() accepte la sortie de VCorpus() et applique des fonctions de nettoyage. Par exemple :

processed_corpus <- clean_corpus(my_corpus)

Cette activité fait partie du cours

Analyse de sentiment en R

Voir le cours

Instructions de l’exercice

Votre session R contient un vecteur de texte, tm_define, avec deux petits documents, ainsi que la fonction clean_corpus().

  • Créez un objet nommé tm_vector en appliquant VectorSource() à tm_define.
  • Créez tm_corpus en utilisant VCorpus() sur tm_vector.
  • Utilisez content() pour examiner le contenu du premier document dans tm_corpus.
    • Les documents du corpus sont accessibles avec la syntaxe de liste, donc utilisez des doubles crochets, p. ex. [[1]].
  • Nettoyez le texte du corpus avec la fonction personnalisée clean_corpus() appliquée à tm_corpus. Nommez ce nouvel objet tm_clean.
  • Examinez de nouveau le premier document du nouvel objet tm_clean pour voir comment le texte a changé après l'application de clean_corpus().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Modifier et exécuter le code