Shlukování metodou k-means a porovnání výsledků
Jak už víš, existují dva hlavní typy shlukování: hierarchické a k-means.
V tomto cvičení vytvoříš model shlukování k-means na datech Wisconsin breast cancer a porovnáš výsledky se skutečnými diagnózami a s výsledky svého hierarchického modelu. Věnuj chvíli tomu, jak si každý model vede při oddělování dvou diagnóz a jak se oba modely navzájem srovnávají.
Toto cvičení je součástí kurzu
Unsupervised Learning in R
Pokyny k cvičení
wisc.data, diagnosis a wisc.hclust.clusters jsou stále k dispozici.
- Vytvoř model k-means na datech
wisc.dataa výsledek ulož dowisc.km. Nezapomeň vytvořit 2 shluky odpovídající skutečnému počtu diagnóz, škálovat data a algoritmus spustit 20krát, aby ses dostal/a k dobře fungujícímu modelu. - Pomocí funkce
table()porovnej příslušnost ke shlukům v modelu k-means se skutečnými diagnózami obsaženými ve vektorudiagnosis. Jak dobře k-means odděluje obě diagnózy? - Pomocí funkce
table()porovnej příslušnost ke shlukům modelu k-means s hierarchickým modelem. Příslušnost ke shlukům hierarchického modelu najdeš vwisc.hclust.clusters.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a k-means model on wisc.data: wisc.km
# Compare k-means to actual diagnoses
# Compare k-means to hierarchical clustering