Skalans betydelse
Du har lärt dig att när en variabel är på en större skala än övriga variabler i dina data kan den få ett oproportionerligt stort inflytande på det beräknade avståndet mellan observationerna. Nu ska vi se detta i praktiken genom att undersöka ett urval av data från datamängden trees.
Du kommer att använda funktionen scale(), som som standard centrerar och skalar kolumnernas särdrag.
Variablerna är följande:
- Girth – trädets diameter i tum
- Height – trädets höjd i tum
Den här övningen är en del av kursen
Klusteranalys i R
Övningsinstruktioner
- Beräkna avståndsmatrisen för dataramen
three_treesoch spara den somdist_trees. - Skapa en ny variabel
scaled_three_treesdär data frånthree_treesär centrerade och skalade. - Beräkna och skriv ut avståndsmatrisen för
scaled_three_treesoch spara den somdist_scaled_trees. - Visa både
dist_treesochdist_scaled_treesoch notera hur det minsta avståndet skiljer sig mellan de två matriserna (ledtråd: det har förändrats).
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Calculate distance for three_trees
dist_trees <- ___
# Scale three trees & calculate the distance
scaled_three_trees <- ___
dist_scaled_trees <- ___
# Output the results of both Matrices
print('Without Scaling')
___
print('With Scaling')
___