Wybór liczby skupień
W tym ćwiczeniu porównasz wyniki hierarchicznego modelu grupowania z rzeczywistymi diagnozami. Zazwyczaj podczas uczenia nienadzorowanego zmienna docelowa nie jest dostępna. W tym zbiorze danych jednak ją mamy – można ją więc wykorzystać do oceny jakości modelu grupowania.
W przypadku uczenia nadzorowanego – czyli gdy próbujesz przewidzieć jakąś zmienną docelową, która jest dostępna w oryginalnych danych – grupowanie w celu tworzenia nowych cech może, ale nie musi poprawiać skuteczności finalnego modelu. To ćwiczenie pomoże ci ocenić, czy grupowanie hierarchiczne dostarcza w tym przypadku obiecującej nowej cechy.
To ćwiczenie jest częścią kursu
Uczenie nienadzorowane w R
Instrukcje do ćwiczenia
wisc.data, diagnosis, wisc.pr, pve i wisc.hclust są dostępne w twoim środowisku pracy.
- Użyj funkcji
cutree(), aby podzielić drzewo na 4 skupienia. Wynik przypisz do zmiennejwisc.hclust.clusters. - Użyj funkcji
table(), aby porównać przynależność do skupień z rzeczywistymi diagnozami.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Cut tree so that it has 4 clusters: wisc.hclust.clusters
# Compare cluster membership to actual diagnoses