Začněte nyníZačněte zdarma

Výběr počtu shluků

V tomto cvičení porovnáš výstupy hierarchického shlukování se skutečnými diagnózami. Při unsupervised učení obvykle cílová proměnná k dispozici není. V tomto datasetu ji ale máme, takže ji lze využít k ověření výkonu shlukového modelu.

Při supervised učení – tedy když se snažíš predikovat nějakou cílovou proměnnou a ta je v původních datech dostupná – může shlukování pro tvorbu nových příznaků výkon finálního modelu zlepšit, ale také nemusí. Toto cvičení ti pomůže zjistit, zda hierarchické shlukování v tomto případě přináší slibný nový příznak.

Toto cvičení je součástí kurzu

Unsupervised Learning in R

Zobrazit kurz

Pokyny k cvičení

Ve tvém pracovním prostoru jsou k dispozici proměnné wisc.data, diagnosis, wisc.pr, pve a wisc.hclust.

  • Pomocí cutree() rozděl strom na 4 shluky. Výsledek ulož do proměnné wisc.hclust.clusters.
  • Pomocí funkce table() porovnej příslušnost ke shlukům se skutečnými diagnózami.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Cut tree so that it has 4 clusters: wisc.hclust.clusters


# Compare cluster membership to actual diagnoses
Upravit a spustit kód