Matrice de distances et dendrogramme
Une façon simple de faire une analyse de regroupement de mots est d'utiliser un dendrogramme sur votre matrice termes-documents. Une fois votre TDM prête, vous pouvez appeler dist() pour calculer les écarts entre chaque ligne de la matrice.
Ensuite, appelez hclust() pour effectuer l'analyse de regroupement à partir des dissimilarités de la matrice de distances. Enfin, vous pouvez visualiser les distances de fréquence des mots à l'aide d'un dendrogramme et de plot(). En fouille de texte, un dendrogramme permet souvent de dégager des pistes intéressantes ou des regroupements de mots.
Considérez le tableau des précipitations annuelles vu dans la dernière vidéo. Cleveland et Portland reçoivent la même quantité de pluie, donc leur distance est 0. Vous pourriez vous attendre à ce que ces deux villes forment un regroupement et que La Nouvelle-Orléans se retrouve seule, puisqu'elle reçoit beaucoup plus de pluie.
city rainfall
Cleveland 39.14
Portland 39.14
Boston 43.77
New Orleans 62.45
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
Le tableau de données rain a été préchargé dans votre espace de travail.
- Créez
dist_rainen utilisant la fonctiondist()sur les valeurs de la deuxième colonne derain. - Affichez la matrice
dist_raindans la console. - Créez
hcen effectuant une analyse de regroupement avechclust()surdist_rain. - Utilisez
plot()sur l'objethcaveclabels = rain$citypour ajouter les noms des villes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create dist_rain
___ <- ___(___)
# View the distance matrix
___
# Create hc
___ <- ___(___)
# Plot hc
___(___, ___)