Utforska könsdata
Datamängden gender innehåller Weight, Height och BMI-index för 10 000 personer. Originaldata har en Gender-etikett för 5 000 personer som identifierar sig som kvinnor och 5 000 som män. Etiketterna är användbara senare för att testa hur väl klustring presterar jämfört med de verkliga etiketterna. I det här deldatasetet saknas dock etiketterna.
Datamängden gender_with_probs innehåller även sannolikheterna för att varje datapunkt tillhör ett kluster. Eftersom vi är intresserade av två kluster refererar sannolikheter nära 1 till det ena klustret och nära 0 till det andra.
Målet med den här övningen är att få en överblick över hur en typisk klustringsdatamängd ser ut före och efter klustring.
Den här övningen är en del av kursen
Blandningsmodeller i R
Övningsinstruktioner
- Använd funktionen
headför att titta på de första 6 observationerna igender. - Använd funktionen
headför att titta på de första 6 observationerna igender_with_probs. - Skapa ett spridningsdiagram med
Weightpå x-axeln ochBMIpå y-axeln. Färglägg punkterna efter deras sannolikhet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)