Vizualizează clusterele
Până în acest punct, avem tot ce ne trebuie pentru a reprezenta grafic observațiile împreună cu elipsele care corespund clusterelor.
Dacă vrei să atribuii fiecare observație unuia dintre cele două clustere, poți folosi funcția clusters() și să compari rezultatele cu etichetele reale. Ca să îți amintești: atunci când am folosit doar variabila Weight pentru a grupa datele, am prezis corect 4500 de femei și 4556 de bărbați. Să vedem dacă separăm mai bine clusterele atunci când includem o variabilă suplimentară.
Acest exercițiu face parte din cursul
Mixture Models în R
Instrucțiuni pentru exercițiu
- Folosește
geom_point()pentru a crea diagrama de dispersie pentruWeightșiBMI. Adaugă la acest grafic cele două elipse salvate înellipses_comp_numbercu ajutorul funcțieigeom_path(). - Reține că elipsele trebuie transformate într-un data frame.
- Colorează clusterul 1 în roșu și clusterul 2 în albastru.
- Estimează tabelul de frecvențe pentru etichetele reale stocate în variabila
Genderfață de cele prezise declusters.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Plot the ellipses
gender %>%
ggplot(aes(x = ___, y = ___)) + ___()+
geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))