CommencerCommencez gratuitement

Rappel sur TM (II)

Créons maintenant une matrice Document-Termes (DTM). Dans une DTM :

  • Chaque ligne de la matrice représente un document.
  • Chaque colonne est un jeton de mot unique.
  • Les valeurs de la matrice correspondent à l'usage des mots dans chaque document.

La DTM sert de base à de nombreuses analyses en « sac de mots ». Plus loin dans le cours, vous utiliserez aussi la matrice Term-Document (TDM) associée. Il s'agit de la transposée : les colonnes représentent les documents et les lignes les jetons de mots uniques.

Vous devez construire une DTM après le nettoyage du corpus (avec clean_corpus()). Pour cela, appelez DocumentTermMatrix() sur l'objet corpus.

tm_dtm <- DocumentTermMatrix(tm_clean)

Si vous avez besoin d'un rappel plus détaillé, consultez le cours Text Mining with Bag-of-Words in R. Nous espérons que ces deux exercices vous ont suffisamment préparé pour vous lancer dans votre analyse de sentiments !

Sachez qu'il s'agit de données réelles issues de Twitter ; il existe donc un risque qu'elles contiennent des grossièretés ou d'autres contenus offensants (dans cet exercice, comme dans tout exercice suivant utilisant aussi de vraies données Twitter).

Cet exercice fait partie du cours

<cours>Analyse de sentiments en R</cours>
Voir le cours

Instructions de l’exercice

Nous avons créé un objet VCorpus() appelé clean_text contenant 1 000 tweets mentionnant le café. Les tweets ont été nettoyés avec les étapes de prétraitement évoquées plus haut, et votre objectif est d'en créer une DTM.

  • Appliquez DocumentTermMatrix() au corpus clean_text pour créer une DTM pondérée par la fréquence des termes appelée tf_dtm.
  • Transformez l'objet DocumentTermMatrix() en une matrice simple avec as.matrix(). Nommez le nouvel objet tf_dtm_m.
  • Vérifiez les dimensions de la matrice avec dim().
  • Utilisez l'indexation entre crochets pour afficher un sous-ensemble de la matrice.
  • Sélectionnez les lignes 16 à 20 et les colonnes 2975 à 2985
  • Relevez la valeur de fréquence du mot « working ».

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# clean_text is pre-defined
clean_text

# Create tf_dtm
tf_dtm <- ___

# Create tf_dtm_m
tf_dtm_m <- ___

# Dimensions of DTM matrix
___

# Subset part of tf_dtm_m for comparison
___[___, ___]
Modifier et exécuter le code