ÎncepețiÎncepe gratuit

Efectele scalei

Ai învățat că atunci când o variabilă are o scară mult mai mare decât celelalte variabile din setul tău de date, ea poate influența disproporționat distanța calculată între observații. Hai să vedem acest lucru în practică, explorând un eșantion din setul de date trees.

Vei folosi funcția scale(), care centrează și scalează implicit coloanele caracteristicilor tale.

Variabilele noastre sunt următoarele:

  • Girth – diametrul copacului în inci
  • Height – înălțimea copacului în inci

Acest exercițiu face parte din cursul

Analiza clusterelor în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează matricea distanțelor pentru cadrul de date three_trees și stocheaz-o ca dist_trees.
  • Creează o nouă variabilă scaled_three_trees în care datele din three_trees sunt centrate și scalate.
  • Calculează și afișează matricea distanțelor pentru scaled_three_trees și stocheaz-o ca dist_scaled_trees.
  • Afișează ambele matrice, dist_trees și dist_scaled_trees, și observă cum se schimbă observațiile cu cea mai mică distanță între cele două matrice (indiciu: acestea s-au modificat).

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Calculate distance for three_trees 
dist_trees <- ___

# Scale three trees & calculate the distance  
scaled_three_trees <- ___
dist_scaled_trees <- ___

# Output the results of both Matrices
print('Without Scaling')
___

print('With Scaling')
___
Editează și rulează codul