Vizualizace clusterů
V tuto chvíli máme vše potřebné k tomu, abychom mohli vykreslit pozorování spolu s elipsami reprezentujícími jednotlivé clustery.
Pokud chceme každé pozorování přiřadit do jednoho ze dvou clusterů, můžeme použít funkci clusters() a porovnat výsledky se skutečnými popisky. Jen pro připomenutí: když jsme pro shlukování dat používali pouze proměnnou Weight, správně jsme zařadili 4500 žen a 4556 mužů. Pojďme zjistit, jestli se nám podaří clustery lépe oddělit po přidání další proměnné.
Toto cvičení je součástí kurzu
Mixture Models v R
Pokyny k cvičení
- Pomocí
geom_point()vytvoř bodový graf pro proměnnéWeightaBMI. Do tohoto grafu přidej dvě elipsy uložené vellipses_comp_numberpomocí funkcegeom_path(). - Nezapomeň, že elipsy je nejprve potřeba převést na datový rámec.
- Cluster 1 obarvi červeně a cluster 2 modře.
- Sestav frekvenční tabulku skutečných popisků uložených v proměnné
Genderoproti předpovězeným hodnotám odhadnutým pomocíclusters.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Plot the ellipses
gender %>%
ggplot(aes(x = ___, y = ___)) + ___()+
geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))