CommencezCommencez gratuitement

Choisir le nombre de grappes

Dans cet exercice, vous comparerez les résultats de votre modèle de groupement hiérarchique aux diagnostics réels. Normalement, dans un contexte d'apprentissage non supervisé comme celui-ci, on n'a pas de variable cible. Avec cet ensemble de données, toutefois, elle est disponible et on peut donc s'en servir pour vérifier la performance du modèle de groupement.

Dans un contexte d'apprentissage supervisé — c'est-à-dire lorsque vous tentez de prédire une variable cible d'intérêt et qu'elle est présente dans les données d'origine — l'utilisation du groupement pour créer de nouvelles caractéristiques peut ou non améliorer la performance du modèle final. Cet exercice vous aidera à déterminer si, dans ce cas-ci, le groupement hiérarchique fournit une nouvelle caractéristique prometteuse.

Cette activité fait partie du cours

Apprentissage non supervisé en R

Voir le cours

Instructions de l’exercice

wisc.data, diagnosis, wisc.pr, pve et wisc.hclust sont disponibles dans votre espace de travail.

  • Utilisez cutree() pour couper l'arbre de façon à obtenir 4 grappes. Attribuez le résultat à la variable wisc.hclust.clusters.
  • Utilisez la fonction table() pour comparer l'appartenance aux grappes aux diagnostics réels.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Cut tree so that it has 4 clusters: wisc.hclust.clusters


# Compare cluster membership to actual diagnoses
Modifier et exécuter le code