Kom igångKom igång gratis

Utforska könsdata

Datamängden gender innehåller Weight, Height och BMI-index för 10 000 personer. Originaldata har en Gender-etikett för 5 000 personer som identifierar sig som kvinnor och 5 000 som män. Etiketterna är användbara senare för att testa hur väl klustring presterar jämfört med de verkliga etiketterna. I det här deldatasetet saknas dock etiketterna.

Datamängden gender_with_probs innehåller även sannolikheterna för att varje datapunkt tillhör ett kluster. Eftersom vi är intresserade av två kluster refererar sannolikheter nära 1 till det ena klustret och nära 0 till det andra.

Målet med den här övningen är att få en överblick över hur en typisk klustrings­datamängd ser ut före och efter klustring.

Den här övningen är en del av kursen

Blandningsmodeller i R

Visa kurs

Övningsinstruktioner

  • Använd funktionen head för att titta på de första 6 observationerna i gender.
  • Använd funktionen head för att titta på de första 6 observationerna i gender_with_probs.
  • Skapa ett spridningsdiagram med Weight på x-axeln och BMI på y-axeln. Färglägg punkterna efter deras sannolikhet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
Redigera och kör kod