Porównanie kmeans() i hclust()
Porównując grupowanie metodą k-średnich z grupowaniem hierarchicznym, zauważysz, że obie metody dają różne przypisania do klastrów. Wynika to z faktu, że oba algorytmy opierają się na różnych założeniach dotyczących struktury danych. W bardziej zaawansowanym kursie można by wybrać jeden model na podstawie jakości jego założeń, ale na razie wystarczy zaobserwować, że wyniki się różnią.
W tym ćwiczeniu porównasz wyniki obu modeli na zbiorze danych pokemon, żeby zobaczyć, czym się od siebie różnią.
To ćwiczenie jest częścią kursu
Uczenie nienadzorowane w R
Instrukcje do ćwiczenia
Wyniki grupowania metodą k-średnich na danych pokemon (dla 3 klastrów) są zapisane jako km.pokemon. Model grupowania hierarchicznego, który utworzyłeś w poprzednim ćwiczeniu, jest nadal dostępny jako hclust.pokemon.
- Używając funkcji
cutree()na obiekciehclust.pokemon, przypisz każdą obserwację do klastra. Przyjmij trzy klastry i zapisz wynik w wektorze o nazwiecut.pokemon. - Używając funkcji
table(), porównaj przynależność do klastrów między obiema metodami. Pamiętaj, że dostęp do poszczególnych komponentów modelu k-średnich uzyskuje się za pomocą operatora$.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Apply cutree() to hclust.pokemon: cut.pokemon
# Compare methods
table(___, ___)