CommencezCommencez gratuitement

Rappel sur TM (II)

Créons maintenant une Document Term Matrix (DTM). Dans une DTM :

  • Chaque rangée de la matrice représente un document.
  • Chaque colonne est un jeton de mot unique.
  • Les valeurs de la matrice correspondent à l'utilisation des mots dans chaque document.

La DTM sert de base à de nombreuses analyses de type « sac de mots ». Plus loin dans le cours, vous utiliserez aussi la Term Document Matrix (TDM) correspondante. Il s'agit de la transposée : les colonnes représentent les documents et les rangées représentent les jetons de mots uniques.

Vous devriez construire une DTM après avoir nettoyé le corpus (à l'aide de clean_corpus()). Pour ce faire, appelez DocumentTermMatrix() sur l'objet corpus.

tm_dtm <- DocumentTermMatrix(tm_clean)

Si vous avez besoin d'un rappel plus approfondi, consultez le cours Text Mining with Bag-of-Words in R. Espérons que ces deux exercices vous ont suffisamment préparé pour vous lancer dans votre parcours d'analyse des sentiments !

Sachez qu'il s'agit de données réelles provenant de Twitter et qu'il y a donc toujours un risque qu'elles contiennent des grossièretés ou d'autres contenus offensants (dans cet exercice et dans tous les exercices suivants qui utilisent aussi de vraies données Twitter).

Cette activité fait partie du cours

Analyse de sentiment en R

Voir le cours

Instructions de l’exercice

Nous avons créé un objet VCorpus() appelé clean_text qui contient 1000 tweets mentionnant le café. Les tweets ont été nettoyés avec les étapes de prétraitement mentionnées plus tôt et votre objectif est d'en créer une DTM.

  • Appliquez DocumentTermMatrix() au corpus clean_text pour créer une DTM pondérée par la fréquence des termes appelée tf_dtm.
  • Transformez l'objet DocumentTermMatrix() en une simple matrice avec as.matrix(). Nommez le nouvel objet tf_dtm_m.
  • Vérifiez les dimensions de la matrice avec dim().
  • Utilisez l'indexation avec des crochets pour afficher un sous-ensemble de la matrice.
  • Sélectionnez les rangées 16 à 20 et les colonnes 2975 à 2985
  • Notez la valeur de fréquence du mot « working ».

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# clean_text is pre-defined
clean_text

# Create tf_dtm
tf_dtm <- ___

# Create tf_dtm_m
tf_dtm_m <- ___

# Dimensions of DTM matrix
___

# Subset part of tf_dtm_m for comparison
___[___, ___]
Modifier et exécuter le code