Kwestie praktyczne: skalowanie
Jak pokazano w filmie, klastrowanie rzeczywistych danych może wymagać skalowania cech, jeśli mają one różne rozkłady. Do tej pory w tym rozdziale pracowałeś z syntetycznymi danymi, które nie wymagały skalowania.
W tym ćwiczeniu wrócisz do pracy z „prawdziwymi" danymi – zbiorem pokemon wprowadzonym w pierwszym rozdziale. Zaobserwujesz rozkład (średnią i odchylenie standardowe) każdej cechy, odpowiednio przeskalojesz dane, a następnie zbudujesz model klastrowania hierarchicznego metodą pełnego połączenia.
To ćwiczenie jest częścią kursu
Uczenie nienadzorowane w R
Instrukcje do ćwiczenia
Dane są zapisane w obiekcie pokemon w twoim środowisku pracy.
- Sprawdź średnią każdej zmiennej w zbiorze
pokemonza pomocą funkcjicolMeans(). - Sprawdź odchylenie standardowe każdej zmiennej, używając funkcji
apply()isd(). Ponieważ zmienne odpowiadają kolumnom macierzy, pamiętaj, aby jako argumentMARGINfunkcjiapply()podać wartość 2. - Przeskaluj dane
pokemonza pomocą funkcjiscale()i zapisz wynik w zmiennejpokemon.scaled. - Zbuduj model klastrowania hierarchicznego na danych
pokemon.scaled, używając metody pełnego połączenia. Jawnie podaj argumentmethodi zapisz wynik w zmiennejhclust.pokemon.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# View column means
# View column standard deviations
# Scale the data
# Create hierarchical clustering model: hclust.pokemon