Zacznij terazZacznij za darmo

Wpływ skali

Wiesz już, że gdy jedna zmienna ma znacznie większą skalę niż pozostałe zmienne w zbiorze danych, może nieproporcjonalnie wpływać na obliczone odległości między obserwacjami. Przekonaj się o tym na przykładzie próbki danych ze zbioru trees.

Wykorzystasz funkcję scale(), która domyślnie centruje i skaluje cechy w kolumnach.

Zmienne w zbiorze danych to:

  • Girth – średnica drzewa w calach
  • Height – wysokość drzewa w calach

To ćwiczenie jest częścią kursu

Analiza skupień w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Oblicz macierz odległości dla ramki danych three_trees i zapisz ją jako dist_trees.
  • Utwórz nową zmienną scaled_three_trees, w której dane z three_trees są wycentrowane i wyskalowane.
  • Oblicz i wyświetl macierz odległości dla scaled_three_trees, zapisując ją jako dist_scaled_trees.
  • Wyświetl obie macierze – dist_trees i dist_scaled_trees – i zwróć uwagę, jak zmieniły się pary obserwacji o najmniejszej odległości (podpowiedź: te pary uległy zmianie).

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Calculate distance for three_trees 
dist_trees <- ___

# Scale three trees & calculate the distance  
scaled_three_trees <- ___
dist_scaled_trees <- ___

# Output the results of both Matrices
print('Without Scaling')
___

print('With Scaling')
___
Edytuj i uruchom kod