Regroupement à partir des résultats de l'ACP
Dans cet exercice final, vous allez rassembler plusieurs étapes utilisées plus tôt et, ce faisant, vous verrez une partie de la créativité qui caractérise souvent l'apprentissage non supervisé.
Rappelez-vous des exercices précédents que le modèle d'ACP nécessitait beaucoup moins de variables pour décrire 80 % et 95 % de la variabilité des données. En plus de normaliser les données et de potentiellement éviter le surapprentissage, l'ACP décorrèle aussi les variables, ce qui peut parfois améliorer la performance d'autres techniques de modélisation.
Voyons si l'ACP améliore ou détériore la performance du regroupement hiérarchique.
Cette activité fait partie du cours
Apprentissage non supervisé en R
Instructions de l’exercice
wisc.pr, diagnosis, wisc.hclust.clusters et wisc.km sont toujours disponibles dans votre espace de travail.
- En utilisant le nombre minimal de composantes principales nécessaires pour décrire au moins 90 % de la variabilité des données, créez un modèle de regroupement hiérarchique avec liaison complète (complete linkage). Assignez les résultats à
wisc.pr.hclust. - Découpez ce modèle de regroupement hiérarchique en 4 grappes et assignez les résultats à
wisc.pr.hclust.clusters. - À l'aide de
table(), comparez les résultats de votre nouveau modèle de regroupement hiérarchique avec les diagnostics réels. Dans quelle mesure le nouveau modèle à quatre grappes sépare-t-il les deux diagnostics? - Dans quelle mesure les modèles k-means et de regroupement hiérarchique que vous avez créés dans les exercices précédents réussissent-ils à séparer les diagnostics? Encore une fois, utilisez la fonction
table()pour comparer la sortie de chaque modèle avec le vecteur contenant les diagnostics réels.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a hierarchical clustering model: wisc.pr.hclust
wisc.pr.hclust <- ___(dist(wisc.pr$___[, ___:___]), method = ___)
# Cut model into 4 clusters: wisc.pr.hclust.clusters
# Compare to actual diagnoses
# Compare to k-means and hierarchical