Kom igångKom igång gratis

Skalans betydelse

Du har lärt dig att när en variabel är på en större skala än övriga variabler i dina data kan den få ett oproportionerligt stort inflytande på det beräknade avståndet mellan observationerna. Nu ska vi se detta i praktiken genom att undersöka ett urval av data från datamängden trees.

Du kommer att använda funktionen scale(), som som standard centrerar och skalar kolumnernas särdrag.

Variablerna är följande:

  • Girth – trädets diameter i tum
  • Height – trädets höjd i tum

Den här övningen är en del av kursen

Klusteranalys i R

Visa kurs

Övningsinstruktioner

  • Beräkna avståndsmatrisen för dataramen three_trees och spara den som dist_trees.
  • Skapa en ny variabel scaled_three_trees där data från three_trees är centrerade och skalade.
  • Beräkna och skriv ut avståndsmatrisen för scaled_three_trees och spara den som dist_scaled_trees.
  • Visa både dist_trees och dist_scaled_trees och notera hur det minsta avståndet skiljer sig mellan de två matriserna (ledtråd: det har förändrats).

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Calculate distance for three_trees 
dist_trees <- ___

# Scale three trees & calculate the distance  
scaled_three_trees <- ___
dist_scaled_trees <- ___

# Output the results of both Matrices
print('Without Scaling')
___

print('With Scaling')
___
Redigera och kör kod