Regroupement hiérarchique des données du cas
L'objectif de cet exercice est d'effectuer un regroupement hiérarchique des observations. Rappelez-vous du chapitre 2 : ce type de regroupement ne suppose pas d'avance le nombre de groupes naturels présents dans les données.
Dans la préparation au regroupement hiérarchique, on calcule la distance entre toutes les paires d'observations. De plus, il existe différentes façons de « lier » les groupes entre eux ; les méthodes de liaison les plus courantes sont single (simple), complete (complète) et average (moyenne).
Cette activité fait partie du cours
Apprentissage non supervisé en R
Instructions de l’exercice
Les variables que vous avez créées plus tôt, wisc.data, diagnosis, wisc.pr et pve, sont disponibles dans votre espace de travail.
- Normalisez les données
wisc.dataet assignez le résultat àdata.scaled. - Calculez les distances (euclidiennes) entre toutes les paires d'observations dans le nouveau jeu de données normalisé et assignez le résultat à
data.dist. - Créez un modèle de regroupement hiérarchique avec la liaison complète. Spécifiez manuellement l'argument
methoddehclust()et assignez le résultat àwisc.hclust.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Scale the wisc.data data: data.scaled
# Calculate the (Euclidean) distances: data.dist
# Create a hierarchical clustering model: wisc.hclust