Regroupement k-means et comparaison des résultats
Vous le savez maintenant, il existe deux grands types de regroupement : hiérarchique et k-means.
Dans cet exercice, vous allez créer un modèle de regroupement k-means sur les données du cancer du sein du Wisconsin et comparer les résultats aux diagnostics réels ainsi qu'aux résultats de votre modèle de regroupement hiérarchique. Prenez le temps d'examiner la performance de chaque modèle pour séparer les deux diagnostics et de voir comment les modèles se comparent entre eux.
Cette activité fait partie du cours
Apprentissage non supervisé en R
Instructions de l’exercice
wisc.data, diagnosis et wisc.hclust.clusters sont toujours disponibles.
- Créez un modèle k-means sur
wisc.dataet affectez le résultat àwisc.km. Assurez-vous de créer 2 grappes, ce qui correspond au nombre réel de diagnostics. N'oubliez pas aussi de normaliser les données et de répéter l'algorithme 20 fois pour obtenir un modèle performant. - Utilisez la fonction
table()pour comparer l'appartenance aux grappes du modèle k-means aux diagnostics réels contenus dans le vecteurdiagnosis. Quelle est la capacité de k-means à séparer les deux diagnostics ? - Utilisez la fonction
table()pour comparer l'appartenance aux grappes du modèle k-means à celle du modèle de regroupement hiérarchique. Rappelez-vous que l'appartenance aux grappes du modèle hiérarchique se trouve danswisc.hclust.clusters.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a k-means model on wisc.data: wisc.km
# Compare k-means to actual diagnoses
# Compare k-means to hierarchical clustering