Grupowanie metodą k-means i porównanie wyników
Jak już wiesz, istnieją dwa główne typy grupowania: hierarchiczne i metodą k-means.
W tym ćwiczeniu zbudujesz model grupowania k-means na danych dotyczących raka piersi z Wisconsin i porównasz wyniki z rzeczywistymi diagnozami oraz z wynikami swojego modelu grupowania hierarchicznego. Przyjrzyj się uważnie, jak dobrze każdy model rozdziela dwie klasy diagnoz i jak oba modele wypadają w porównaniu ze sobą.
To ćwiczenie jest częścią kursu
Uczenie nienadzorowane w R
Instrukcje do ćwiczenia
wisc.data, diagnosis i wisc.hclust.clusters są nadal dostępne.
- Utwórz model k-means na danych
wisc.datai przypisz wynik dowisc.km. Pamiętaj, aby ustawić 2 grupy odpowiadające rzeczywistej liczbie klas diagnozy. Przeskaluj dane i uruchom algorytm 20 razy, by znaleźć dobrze działający model. - Użyj funkcji
table(), aby porównać przynależność do grup w modelu k-means z rzeczywistymi diagnozami zawartymi w wektorzediagnosis. Jak dobrze k-means rozdziela dwie klasy diagnoz? - Użyj funkcji
table(), aby porównać przynależność do grup w modelu k-means z modelem grupowania hierarchicznego. Przynależność do grup w modelu hierarchicznym jest przechowywana wwisc.hclust.clusters.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a k-means model on wisc.data: wisc.km
# Compare k-means to actual diagnoses
# Compare k-means to hierarchical clustering