CommencezCommencez gratuitement

Aspects pratiques : mise à l'échelle

Rappelez-vous, d'après la vidéo, que le regroupement de vraies données peut nécessiter la mise à l'échelle des caractéristiques si leurs distributions diffèrent. Jusqu'ici dans ce chapitre, vous avez travaillé avec des données synthétiques qui n'avaient pas besoin de mise à l'échelle.

Dans cet exercice, vous revenez à des données « réelles », l'ensemble pokemon présenté au premier chapitre. Vous allez observer la distribution (moyenne et écart type) de chaque caractéristique, mettre les données à l'échelle en conséquence, puis produire un modèle de regroupement hiérarchique en utilisant la méthode de chaînage complet (complete linkage).

Cette activité fait partie du cours

Apprentissage non supervisé en R

Voir le cours

Instructions de l’exercice

Les données se trouvent dans l'objet pokemon de votre espace de travail.

  • Observez la moyenne de chaque variable de pokemon à l'aide de la fonction colMeans().
  • Observez l'écart type de chaque variable à l'aide des fonctions apply() et sd(). Puisque les variables sont les colonnes de votre matrice, assurez-vous d'indiquer 2 comme valeur de l'argument MARGIN de apply().
  • Mettez les données pokemon à l'échelle avec la fonction scale() et enregistrez le résultat dans pokemon.scaled.
  • Créez un modèle de regroupement hiérarchique des données pokemon.scaled en utilisant la méthode de chaînage complet. Indiquez manuellement l'argument method et enregistrez le résultat dans hclust.pokemon.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# View column means


# View column standard deviations


# Scale the data


# Create hierarchical clustering model: hclust.pokemon
Modifier et exécuter le code