Visualisera klustren
Nu har vi allt som behövs för att plotta observationerna tillsammans med de ellipser som representerar klustren.
Om vi vill tilldela varje observation till ett av de två klustren kan vi använda funktionen clusters() och jämföra resultaten med de verkliga etiketterna. Som en påminnelse: när vi enbart använde variabeln Weight för att klustra datan förutsade vi korrekt 4500 kvinnor och 4556 män. Låt oss se om klustren går att separera bättre när en ytterligare variabel inkluderas.
Den här övningen är en del av kursen
Blandningsmodeller i R
Övningsinstruktioner
- Använd
geom_point()för att skapa ett spridningsdiagram förWeightochBMI. Lägg till de två ellipserna som sparats iellipses_comp_numbermed hjälp av funktionengeom_path(). - Tänk på att ellipserna måste omvandlas till en dataram.
- Färglägg kluster 1 i rött och kluster 2 i blått.
- Beräkna frekvenstabell för de verkliga etiketterna lagrade i variabeln
Genderjämfört med de förutsagda etiketterna frånclusters.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Plot the ellipses
gender %>%
ggplot(aes(x = ___, y = ___)) + ___()+
geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))