CommencezCommencez gratuitement

Rassembler le tout : un dendrogramme basé sur le texte

Il est temps de mettre vos compétences en pratique pour créer votre premier dendrogramme basé sur le texte. Rappelez-vous que les dendrogrammes réduisent l'information pour vous aider à interpréter les données. C'est un peu comme une moyenne : elle vous renseigne sur une population, mais pas sur tout. Les deux peuvent être trompeurs. Avec du texte, on obtient souvent beaucoup de regroupements absurdes, mais certains groupes pertinents peuvent aussi apparaître.

Une particularité des objets TDM et DTM est que vous devez d'abord les convertir en matrices (avec as.matrix()), avant de les utiliser avec la fonction dist().

Pour les tweets sur le chardonnay, vous avez peut-être été surpris de voir la légende de la soul Marvin Gaye apparaître dans le nuage de mots. Voyons si le dendrogramme met en évidence la même chose.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

  • Créez tweets_tdm2 en appliquant removeSparseTerms() sur tweets_tdm. Utilisez sparse = 0.975.
  • Créez tdm_m en utilisant as.matrix() sur tweets_tdm2 pour le convertir en matrice.
  • Créez tweets_dist contenant les distances de tdm_m à l'aide de la fonction dist().
  • Créez un objet de groupement hiérarchique nommé hc en utilisant hclust() sur tweets_dist.
  • Tracez un dendrogramme avec plot() et hc.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create tweets_tdm2
___ <- ___(___, ___)

# Create tdm_m
___ <- ___(___)

# Create tweets_dist
___ <- ___(___)

# Create hc
___ <- ___(___)

# Plot the dendrogram
___(___)
Modifier et exécuter le code