Shlukování na základě výsledků PCA
V tomto závěrečném cvičení propojíš několik kroků, které jsi použil/a dříve, a zažiješ tak kousek té kreativity, která je pro unsupervised learning typická.
Z předchozích cvičení víš, že model PCA potřeboval výrazně méně proměnných k popisu 80 % a 95 % variability dat. Kromě normalizace dat a potenciálního snížení rizika přetrénování modelu PCA také odstraňuje korelace mezi proměnnými, což někdy zlepšuje výkon dalších modelovacích technik.
Podívejme se, jestli PCA výkon hierarchického shlukování zlepší, nebo naopak sníží.
Toto cvičení je součástí kurzu
Unsupervised Learning in R
Pokyny k cvičení
wisc.pr, diagnosis, wisc.hclust.clusters a wisc.km jsou stále dostupné v tvém pracovním prostředí.
- Pomocí minimálního počtu hlavních komponent potřebných k popisu alespoň 90 % variability dat vytvoř model hierarchického shlukování s úplným propojením (complete linkage). Výsledek ulož do
wisc.pr.hclust. - Rozděl tento model hierarchického shlukování na 4 shluky a výsledek ulož do
wisc.pr.hclust.clusters. - Pomocí funkce
table()porovnej výsledky nového modelu hierarchického shlukování se skutečnými diagnózami. Jak dobře nový model se čtyřmi shluky odděluje obě diagnózy? - Jak dobře modely k-means a hierarchického shlukování z předchozích cvičení oddělují diagnózy? Opět použij funkci
table()a porovnej výstup každého modelu s vektorem obsahujícím skutečné diagnózy.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a hierarchical clustering model: wisc.pr.hclust
wisc.pr.hclust <- ___(dist(wisc.pr$___[, ___:___]), method = ___)
# Cut model into 4 clusters: wisc.pr.hclust.clusters
# Compare to actual diagnoses
# Compare to k-means and hierarchical