CommencezCommencez gratuitement

Créer une MDT adaptée au dendrogramme

Maintenant que vous comprenez les étapes pour créer un dendrogramme, vous pouvez les appliquer au texte. Mais d'abord, vous devez limiter le nombre de mots dans votre MDT à l'aide de removeSparseTerms() du paquet tm. Pourquoi voudriez-vous ajuster la parcimonie de la MDT/MDT?

Les MDT et MDT sont clairsemées, c'est-à-dire qu'elles contiennent surtout des zéros. Rappelez-vous que 1 000 tweets peuvent devenir une MDT avec plus de 3 000 termes! Vous ne pourrez pas interpréter facilement un dendrogramme aussi chargé, surtout si vous travaillez avec plus de texte.

Dans la plupart des contextes professionnels, un bon dendrogramme repose sur une MDT contenant de 25 à 70 termes. Au-delà de 70, la visualisation risque d'être encombrée et incompréhensible. À l'inverse, moins de 25 termes signifie probablement que votre dendrogramme ne fera pas ressortir des groupes pertinents et éclairants.

Lorsque vous utilisez removeSparseTerms(), le paramètre sparse ajuste le nombre total de termes conservés dans la MDT. Plus sparse est proche de 1, plus on conserve de termes. Cette valeur représente un seuil de pourcentage de zéros pour chaque terme dans la MDT.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

tweets_tdm a été créé à partir des tweets sur le chardonnay.

  • Affichez les dimensions de tweets_tdm dans la console.
  • Créez tdm1 avec removeSparseTerms() et sparse = 0.95 sur tweets_tdm.
  • Créez tdm2 avec removeSparseTerms() et sparse = 0.975 sur tweets_tdm.
  • Affichez tdm1 dans la console pour voir combien de termes restent.
  • Affichez tdm2 dans la console pour voir combien de termes restent.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Print the dimensions of tweets_tdm
___

# Create tdm1
___ <- ___(___, ___)

# Create tdm2
___ <- ___(___, ___)

# Print tdm1
___

# Print tdm2
___
Modifier et exécuter le code