CommencezCommencez gratuitement

Regroupement à partir des résultats de l'ACP

Dans cet exercice final, vous allez rassembler plusieurs étapes utilisées plus tôt et, ce faisant, vous verrez une partie de la créativité qui caractérise souvent l'apprentissage non supervisé.

Rappelez-vous des exercices précédents que le modèle d'ACP nécessitait beaucoup moins de variables pour décrire 80 % et 95 % de la variabilité des données. En plus de normaliser les données et de potentiellement éviter le surapprentissage, l'ACP décorrèle aussi les variables, ce qui peut parfois améliorer la performance d'autres techniques de modélisation.

Voyons si l'ACP améliore ou détériore la performance du regroupement hiérarchique.

Cette activité fait partie du cours

Apprentissage non supervisé en R

Voir le cours

Instructions de l’exercice

wisc.pr, diagnosis, wisc.hclust.clusters et wisc.km sont toujours disponibles dans votre espace de travail.

  • En utilisant le nombre minimal de composantes principales nécessaires pour décrire au moins 90 % de la variabilité des données, créez un modèle de regroupement hiérarchique avec liaison complète (complete linkage). Assignez les résultats à wisc.pr.hclust.
  • Découpez ce modèle de regroupement hiérarchique en 4 grappes et assignez les résultats à wisc.pr.hclust.clusters.
  • À l'aide de table(), comparez les résultats de votre nouveau modèle de regroupement hiérarchique avec les diagnostics réels. Dans quelle mesure le nouveau modèle à quatre grappes sépare-t-il les deux diagnostics?
  • Dans quelle mesure les modèles k-means et de regroupement hiérarchique que vous avez créés dans les exercices précédents réussissent-ils à séparer les diagnostics? Encore une fois, utilisez la fonction table() pour comparer la sortie de chaque modèle avec le vecteur contenant les diagnostics réels.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a hierarchical clustering model: wisc.pr.hclust
wisc.pr.hclust <- ___(dist(wisc.pr$___[, ___:___]), method = ___)

# Cut model into 4 clusters: wisc.pr.hclust.clusters


# Compare to actual diagnoses


# Compare to k-means and hierarchical
Modifier et exécuter le code