Aspects pratiques : mise à l'échelle
Rappelez-vous, d'après la vidéo, que le regroupement de vraies données peut nécessiter la mise à l'échelle des caractéristiques si leurs distributions diffèrent. Jusqu'ici dans ce chapitre, vous avez travaillé avec des données synthétiques qui n'avaient pas besoin de mise à l'échelle.
Dans cet exercice, vous revenez à des données « réelles », l'ensemble pokemon présenté au premier chapitre. Vous allez observer la distribution (moyenne et écart type) de chaque caractéristique, mettre les données à l'échelle en conséquence, puis produire un modèle de regroupement hiérarchique en utilisant la méthode de chaînage complet (complete linkage).
Cette activité fait partie du cours
Apprentissage non supervisé en R
Instructions de l’exercice
Les données se trouvent dans l'objet pokemon de votre espace de travail.
- Observez la moyenne de chaque variable de
pokemonà l'aide de la fonctioncolMeans(). - Observez l'écart type de chaque variable à l'aide des fonctions
apply()etsd(). Puisque les variables sont les colonnes de votre matrice, assurez-vous d'indiquer 2 comme valeur de l'argumentMARGINdeapply(). - Mettez les données
pokemonà l'échelle avec la fonctionscale()et enregistrez le résultat danspokemon.scaled. - Créez un modèle de regroupement hiérarchique des données
pokemon.scaleden utilisant la méthode de chaînage complet. Indiquez manuellement l'argumentmethodet enregistrez le résultat danshclust.pokemon.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# View column means
# View column standard deviations
# Scale the data
# Create hierarchical clustering model: hclust.pokemon