CommencezCommencez gratuitement

Créer une matrice documents-termes

On espère que vous n'êtes pas trop fatigué après tout ce travail de fouille de texte de base ! Par précaution, revenons au café et allons chercher un Starbucks tout en construisant une matrice documents-termes à partir de gazouillis sur le café.

En partant du fichier coffee.csv, nous avons appliqué des transformations courantes pour produire un corpus propre appelé clean_corp.

La matrice documents-termes est utilisée quand vous voulez représenter chaque document sous forme de ligne. C'est utile, par exemple, si vous comparez des auteurs ligne par ligne, ou si les données sont organisées chronologiquement et que vous souhaitez préserver la série chronologique. Le paquet tm utilise une classe « simple triplet matrix ». Cependant, il est souvent plus facile de manipuler et d'examiner l'objet en reclassant la DTM avec as.matrix()

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

  • Créez coffee_dtm en appliquant DocumentTermMatrix() à clean_corp.
  • Créez coffee_m, une version matricielle de coffee_dtm, en utilisant as.matrix().
  • Affichez les dimensions de coffee_m dans la console avec la fonction dim(). Notez le nombre de lignes et de colonnes.
  • Affichez le sous-ensemble de coffee_m contenant les documents (lignes) 25 à 35 et les termes (colonnes) "star" et "starbucks".

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create the document-term matrix from the corpus
coffee_dtm <- ___

# Print out coffee_dtm data
coffee_dtm

# Convert coffee_dtm to a matrix
coffee_m <- ___

# Print the dimensions of coffee_m
___

# Review a portion of the matrix to get some Starbucks
___[___:___, c("star", "___")]
Modifier et exécuter le code