Výběr počtu shluků
V tomto cvičení porovnáš výstupy hierarchického shlukování se skutečnými diagnózami. Při unsupervised učení obvykle cílová proměnná k dispozici není. V tomto datasetu ji ale máme, takže ji lze využít k ověření výkonu shlukového modelu.
Při supervised učení – tedy když se snažíš predikovat nějakou cílovou proměnnou a ta je v původních datech dostupná – může shlukování pro tvorbu nových příznaků výkon finálního modelu zlepšit, ale také nemusí. Toto cvičení ti pomůže zjistit, zda hierarchické shlukování v tomto případě přináší slibný nový příznak.
Toto cvičení je součástí kurzu
Unsupervised Learning in R
Pokyny k cvičení
Ve tvém pracovním prostoru jsou k dispozici proměnné wisc.data, diagnosis, wisc.pr, pve a wisc.hclust.
- Pomocí
cutree()rozděl strom na 4 shluky. Výsledek ulož do proměnnéwisc.hclust.clusters. - Pomocí funkce
table()porovnej příslušnost ke shlukům se skutečnými diagnózami.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Cut tree so that it has 4 clusters: wisc.hclust.clusters
# Compare cluster membership to actual diagnoses