CommencezCommencez gratuitement

Matrice de distances et dendrogramme

Une façon simple de faire une analyse de regroupement de mots est d'utiliser un dendrogramme sur votre matrice termes-documents. Une fois votre TDM prête, vous pouvez appeler dist() pour calculer les écarts entre chaque ligne de la matrice.

Ensuite, appelez hclust() pour effectuer l'analyse de regroupement à partir des dissimilarités de la matrice de distances. Enfin, vous pouvez visualiser les distances de fréquence des mots à l'aide d'un dendrogramme et de plot(). En fouille de texte, un dendrogramme permet souvent de dégager des pistes intéressantes ou des regroupements de mots.

Considérez le tableau des précipitations annuelles vu dans la dernière vidéo. Cleveland et Portland reçoivent la même quantité de pluie, donc leur distance est 0. Vous pourriez vous attendre à ce que ces deux villes forment un regroupement et que La Nouvelle-Orléans se retrouve seule, puisqu'elle reçoit beaucoup plus de pluie.

       city rainfall
  Cleveland    39.14
   Portland    39.14
     Boston    43.77
New Orleans    62.45

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

Le tableau de données rain a été préchargé dans votre espace de travail.

  • Créez dist_rain en utilisant la fonction dist() sur les valeurs de la deuxième colonne de rain.
  • Affichez la matrice dist_rain dans la console.
  • Créez hc en effectuant une analyse de regroupement avec hclust() sur dist_rain.
  • Utilisez plot() sur l'objet hc avec labels = rain$city pour ajouter les noms des villes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create dist_rain
___ <- ___(___)

# View the distance matrix
___

# Create hc
___ <- ___(___)

# Plot hc
___(___, ___)
Modifier et exécuter le code