Rappel sur TM (II)
Créons maintenant une matrice Document-Termes (DTM). Dans une DTM :
- Chaque ligne de la matrice représente un document.
- Chaque colonne est un jeton de mot unique.
- Les valeurs de la matrice correspondent à l'usage des mots dans chaque document.
La DTM sert de base à de nombreuses analyses en « sac de mots ». Plus loin dans le cours, vous utiliserez aussi la matrice Term-Document (TDM) associée. Il s'agit de la transposée : les colonnes représentent les documents et les lignes les jetons de mots uniques.
Vous devez construire une DTM après le nettoyage du corpus (avec clean_corpus()). Pour cela, appelez DocumentTermMatrix() sur l'objet corpus.
tm_dtm <- DocumentTermMatrix(tm_clean)
Si vous avez besoin d'un rappel plus détaillé, consultez le cours Text Mining with Bag-of-Words in R. Nous espérons que ces deux exercices vous ont suffisamment préparé pour vous lancer dans votre analyse de sentiments !
Sachez qu'il s'agit de données réelles issues de Twitter ; il existe donc un risque qu'elles contiennent des grossièretés ou d'autres contenus offensants (dans cet exercice, comme dans tout exercice suivant utilisant aussi de vraies données Twitter).
Cet exercice fait partie du cours
<cours>Analyse de sentiments en R</cours>Instructions de l’exercice
Nous avons créé un objet VCorpus() appelé clean_text contenant 1 000 tweets mentionnant le café. Les tweets ont été nettoyés avec les étapes de prétraitement évoquées plus haut, et votre objectif est d'en créer une DTM.
- Appliquez
DocumentTermMatrix()au corpusclean_textpour créer une DTM pondérée par la fréquence des termes appeléetf_dtm. - Transformez l'objet
DocumentTermMatrix()en une matrice simple avecas.matrix(). Nommez le nouvel objettf_dtm_m. - Vérifiez les dimensions de la matrice avec
dim(). - Utilisez l'indexation entre crochets pour afficher un sous-ensemble de la matrice.
- Sélectionnez les lignes 16 à 20 et les colonnes 2975 à 2985
- Relevez la valeur de fréquence du mot « working ».
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]