Effets de l'échelle
Vous avez vu que lorsqu'une variable est mesurée sur une échelle plus grande que les autres variables de vos données, elle peut influencer de façon disproportionnée la distance calculée entre vos observations. Voyons cela en action avec un échantillon de données tiré de l'ensemble trees.
Vous utiliserez la fonction scale() qui, par défaut, centre et met à l'échelle nos colonnes de caractéristiques.
Nos variables sont les suivantes :
- Girth — diamètre de l'arbre en pouces
- Height — hauteur de l'arbre en pouces
Cette activité fait partie du cours
Analyse de regroupements dans R
Instructions de l’exercice
- Calculez la matrice de distances pour le tableau de données
three_treeset stockez-la dansdist_trees. - Créez une nouvelle variable
scaled_three_treesoù les données dethree_treessont centrées et mises à l'échelle. - Calculez et affichez la matrice de distances pour
scaled_three_treeset stockez-la dansdist_scaled_trees. - Affichez les matrices
dist_treesetdist_scaled_trees, puis observez le changement quant aux observations qui ont la plus petite distance entre les deux matrices (indice : elles ont changé).
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Calculate distance for three_trees
dist_trees <- ___
# Scale three trees & calculate the distance
scaled_three_trees <- ___
dist_scaled_trees <- ___
# Output the results of both Matrices
print('Without Scaling')
___
print('With Scaling')
___