CommencezCommencez gratuitement

Regroupement hiérarchique des données du cas

L'objectif de cet exercice est d'effectuer un regroupement hiérarchique des observations. Rappelez-vous du chapitre 2 : ce type de regroupement ne suppose pas d'avance le nombre de groupes naturels présents dans les données.

Dans la préparation au regroupement hiérarchique, on calcule la distance entre toutes les paires d'observations. De plus, il existe différentes façons de « lier » les groupes entre eux ; les méthodes de liaison les plus courantes sont single (simple), complete (complète) et average (moyenne).

Cette activité fait partie du cours

Apprentissage non supervisé en R

Voir le cours

Instructions de l’exercice

Les variables que vous avez créées plus tôt, wisc.data, diagnosis, wisc.pr et pve, sont disponibles dans votre espace de travail.

  • Normalisez les données wisc.data et assignez le résultat à data.scaled.
  • Calculez les distances (euclidiennes) entre toutes les paires d'observations dans le nouveau jeu de données normalisé et assignez le résultat à data.dist.
  • Créez un modèle de regroupement hiérarchique avec la liaison complète. Spécifiez manuellement l'argument method de hclust() et assignez le résultat à wisc.hclust.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Scale the wisc.data data: data.scaled


# Calculate the (Euclidean) distances: data.dist


# Create a hierarchical clustering model: wisc.hclust
Modifier et exécuter le code