CommencerCommencez gratuitement

Rappel TM (I)

Dans le cours Text Mining: Bag of Words, vous avez appris qu'un corpus est un ensemble de textes, et vous avez étudié des fonctions de prétraitement du texte. Pour récapituler, une façon de créer et nettoyer un corpus consiste à utiliser les fonctions ci-dessous. Même si ce cours est différent, l'analyse de sentiments fait partie du text mining ; un petit rappel peut donc être utile.

Dans cet exercice, une fonction personnalisée clean_corpus() a été créée à partir de fonctions de prétraitement standard pour en faciliter l'usage.

clean_corpus() accepte la sortie de VCorpus() et applique des fonctions de nettoyage. Par exemple :

processed_corpus <- clean_corpus(my_corpus)

Cet exercice fait partie du cours

<cours>Analyse de sentiments en R</cours>
Voir le cours

Instructions de l’exercice

Votre session R contient un vecteur de texte, tm_define, avec deux petits documents, ainsi que la fonction clean_corpus().

  • Créez un objet appelé tm_vector en appliquant VectorSource() à tm_define.
  • Créez tm_corpus en utilisant VCorpus() sur tm_vector.
  • Utilisez content() pour examiner le contenu du premier document de tm_corpus.
    • Les documents du corpus sont accessibles avec la syntaxe des listes ; utilisez donc des doubles crochets, par exemple [[1]].
  • Nettoyez le texte du corpus en appliquant la fonction personnalisée clean_corpus() à tm_corpus. Nommez ce nouvel objet tm_clean.
  • Examinez à nouveau le premier document du nouvel objet tm_clean pour voir comment le texte a changé après l'application de clean_corpus().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Modifier et exécuter le code