Rassembler le tout : un dendrogramme basé sur le texte
Il est temps de mettre vos compétences en pratique pour créer votre premier dendrogramme basé sur le texte. Rappelez-vous que les dendrogrammes réduisent l'information pour vous aider à interpréter les données. C'est un peu comme une moyenne : elle vous renseigne sur une population, mais pas sur tout. Les deux peuvent être trompeurs. Avec du texte, on obtient souvent beaucoup de regroupements absurdes, mais certains groupes pertinents peuvent aussi apparaître.
Une particularité des objets TDM et DTM est que vous devez d'abord les convertir en matrices (avec as.matrix()), avant de les utiliser avec la fonction dist().
Pour les tweets sur le chardonnay, vous avez peut-être été surpris de voir la légende de la soul Marvin Gaye apparaître dans le nuage de mots. Voyons si le dendrogramme met en évidence la même chose.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
- Créez
tweets_tdm2en appliquantremoveSparseTerms()surtweets_tdm. Utilisezsparse = 0.975. - Créez
tdm_men utilisantas.matrix()surtweets_tdm2pour le convertir en matrice. - Créez
tweets_distcontenant les distances detdm_mà l'aide de la fonctiondist(). - Créez un objet de groupement hiérarchique nommé
hcen utilisanthclust()surtweets_dist. - Tracez un dendrogramme avec
plot()ethc.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create tweets_tdm2
___ <- ___(___, ___)
# Create tdm_m
___ <- ___(___)
# Create tweets_dist
___ <- ___(___)
# Create hc
___ <- ___(___)
# Plot the dendrogram
___(___)