Créer une MDT adaptée au dendrogramme
Maintenant que vous comprenez les étapes pour créer un dendrogramme, vous pouvez les appliquer au texte. Mais d'abord, vous devez limiter le nombre de mots dans votre MDT à l'aide de removeSparseTerms() du paquet tm. Pourquoi voudriez-vous ajuster la parcimonie de la MDT/MDT?
Les MDT et MDT sont clairsemées, c'est-à-dire qu'elles contiennent surtout des zéros. Rappelez-vous que 1 000 tweets peuvent devenir une MDT avec plus de 3 000 termes! Vous ne pourrez pas interpréter facilement un dendrogramme aussi chargé, surtout si vous travaillez avec plus de texte.
Dans la plupart des contextes professionnels, un bon dendrogramme repose sur une MDT contenant de 25 à 70 termes. Au-delà de 70, la visualisation risque d'être encombrée et incompréhensible. À l'inverse, moins de 25 termes signifie probablement que votre dendrogramme ne fera pas ressortir des groupes pertinents et éclairants.
Lorsque vous utilisez removeSparseTerms(), le paramètre sparse ajuste le nombre total de termes conservés dans la MDT. Plus sparse est proche de 1, plus on conserve de termes. Cette valeur représente un seuil de pourcentage de zéros pour chaque terme dans la MDT.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
tweets_tdm a été créé à partir des tweets sur le chardonnay.
- Affichez les dimensions de
tweets_tdmdans la console. - Créez
tdm1avecremoveSparseTerms()etsparse = 0.95surtweets_tdm. - Créez
tdm2avecremoveSparseTerms()etsparse = 0.975surtweets_tdm. - Affichez
tdm1dans la console pour voir combien de termes restent. - Affichez
tdm2dans la console pour voir combien de termes restent.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Print the dimensions of tweets_tdm
___
# Create tdm1
___ <- ___(___, ___)
# Create tdm2
___ <- ___(___, ___)
# Print tdm1
___
# Print tdm2
___