Kom igångKom igång gratis

Visualisera klustren

Nu har vi allt som behövs för att plotta observationerna tillsammans med de ellipser som representerar klustren.

Om vi vill tilldela varje observation till ett av de två klustren kan vi använda funktionen clusters() och jämföra resultaten med de verkliga etiketterna. Som en påminnelse: när vi enbart använde variabeln Weight för att klustra datan förutsade vi korrekt 4500 kvinnor och 4556 män. Låt oss se om klustren går att separera bättre när en ytterligare variabel inkluderas.

Den här övningen är en del av kursen

Blandningsmodeller i R

Visa kurs

Övningsinstruktioner

  • Använd geom_point() för att skapa ett spridningsdiagram för Weight och BMI. Lägg till de två ellipserna som sparats i ellipses_comp_number med hjälp av funktionen geom_path().
  • Tänk på att ellipserna måste omvandlas till en dataram.
  • Färglägg kluster 1 i rött och kluster 2 i blått.
  • Beräkna frekvenstabell för de verkliga etiketterna lagrade i variabeln Gender jämfört med de förutsagda etiketterna från clusters.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Plot the ellipses
gender %>% 
  ggplot(aes(x = ___, y = ___)) + ___()+
  geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
  geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))
Redigera och kör kod