Créer une matrice documents-termes
On espère que vous n'êtes pas trop fatigué après tout ce travail de fouille de texte de base ! Par précaution, revenons au café et allons chercher un Starbucks tout en construisant une matrice documents-termes à partir de gazouillis sur le café.
En partant du fichier coffee.csv, nous avons appliqué des transformations courantes pour produire un corpus propre appelé clean_corp.
La matrice documents-termes est utilisée quand vous voulez représenter chaque document sous forme de ligne. C'est utile, par exemple, si vous comparez des auteurs ligne par ligne, ou si les données sont organisées chronologiquement et que vous souhaitez préserver la série chronologique. Le paquet tm utilise une classe « simple triplet matrix ». Cependant, il est souvent plus facile de manipuler et d'examiner l'objet en reclassant la DTM avec as.matrix()
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
- Créez
coffee_dtmen appliquantDocumentTermMatrix()àclean_corp. - Créez
coffee_m, une version matricielle decoffee_dtm, en utilisantas.matrix(). - Affichez les dimensions de
coffee_mdans la console avec la fonctiondim(). Notez le nombre de lignes et de colonnes. - Affichez le sous-ensemble de
coffee_mcontenant les documents (lignes) 25 à 35 et les termes (colonnes)"star"et"starbucks".
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create the document-term matrix from the corpus
coffee_dtm <- ___
# Print out coffee_dtm data
coffee_dtm
# Convert coffee_dtm to a matrix
coffee_m <- ___
# Print the dimensions of coffee_m
___
# Review a portion of the matrix to get some Starbucks
___[___:___, c("star", "___")]