Efectele scalei
Ai învățat că atunci când o variabilă are o scară mult mai mare decât celelalte variabile din setul tău de date, ea poate influența disproporționat distanța calculată între observații. Hai să vedem acest lucru în practică, explorând un eșantion din setul de date trees.
Vei folosi funcția scale(), care centrează și scalează implicit coloanele caracteristicilor tale.
Variabilele noastre sunt următoarele:
- Girth – diametrul copacului în inci
- Height – înălțimea copacului în inci
Acest exercițiu face parte din cursul
Analiza clusterelor în R
Instrucțiuni pentru exercițiu
- Calculează matricea distanțelor pentru cadrul de date
three_treesși stocheaz-o cadist_trees. - Creează o nouă variabilă
scaled_three_treesîn care datele dinthree_treessunt centrate și scalate. - Calculează și afișează matricea distanțelor pentru
scaled_three_treesși stocheaz-o cadist_scaled_trees. - Afișează ambele matrice,
dist_treesșidist_scaled_trees, și observă cum se schimbă observațiile cu cea mai mică distanță între cele două matrice (indiciu: acestea s-au modificat).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Calculate distance for three_trees
dist_trees <- ___
# Scale three trees & calculate the distance
scaled_three_trees <- ___
dist_scaled_trees <- ___
# Output the results of both Matrices
print('Without Scaling')
___
print('With Scaling')
___