Wpływ skali
Wiesz już, że gdy jedna zmienna ma znacznie większą skalę niż pozostałe zmienne w zbiorze danych, może nieproporcjonalnie wpływać na obliczone odległości między obserwacjami. Przekonaj się o tym na przykładzie próbki danych ze zbioru trees.
Wykorzystasz funkcję scale(), która domyślnie centruje i skaluje cechy w kolumnach.
Zmienne w zbiorze danych to:
- Girth – średnica drzewa w calach
- Height – wysokość drzewa w calach
To ćwiczenie jest częścią kursu
Analiza skupień w R
Instrukcje do ćwiczenia
- Oblicz macierz odległości dla ramki danych
three_treesi zapisz ją jakodist_trees. - Utwórz nową zmienną
scaled_three_trees, w której dane zthree_treessą wycentrowane i wyskalowane. - Oblicz i wyświetl macierz odległości dla
scaled_three_trees, zapisując ją jakodist_scaled_trees. - Wyświetl obie macierze –
dist_treesidist_scaled_trees– i zwróć uwagę, jak zmieniły się pary obserwacji o najmniejszej odległości (podpowiedź: te pary uległy zmianie).
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Calculate distance for three_trees
dist_trees <- ___
# Scale three trees & calculate the distance
scaled_three_trees <- ___
dist_scaled_trees <- ___
# Output the results of both Matrices
print('Without Scaling')
___
print('With Scaling')
___