ÎncepețiÎncepe gratuit

Vizualizează clusterele

Până în acest punct, avem tot ce ne trebuie pentru a reprezenta grafic observațiile împreună cu elipsele care corespund clusterelor.

Dacă vrei să atribuii fiecare observație unuia dintre cele două clustere, poți folosi funcția clusters() și să compari rezultatele cu etichetele reale. Ca să îți amintești: atunci când am folosit doar variabila Weight pentru a grupa datele, am prezis corect 4500 de femei și 4556 de bărbați. Să vedem dacă separăm mai bine clusterele atunci când includem o variabilă suplimentară.

Acest exercițiu face parte din cursul

Mixture Models în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește geom_point() pentru a crea diagrama de dispersie pentru Weight și BMI. Adaugă la acest grafic cele două elipse salvate în ellipses_comp_number cu ajutorul funcției geom_path().
  • Reține că elipsele trebuie transformate într-un data frame.
  • Colorează clusterul 1 în roșu și clusterul 2 în albastru.
  • Estimează tabelul de frecvențe pentru etichetele reale stocate în variabila Gender față de cele prezise de clusters.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Plot the ellipses
gender %>% 
  ggplot(aes(x = ___, y = ___)) + ___()+
  geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
  geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))
Editează și rulează codul