Prozkoumej data o pohlaví
Data gender obsahují hodnoty Weight (váha), Height (výška) a index BMI pro 10 000 osob. Původní data obsahují štítek Gender pro 5 000 osob, které se identifikují jako ženy, a 5 000 osob, které se identifikují jako muži. Tyto štítky se budou hodit později při testování, jak dobře shlukování odpovídá skutečným označením. V této podmnožině dat ale štítky nejsou k dispozici.
Data gender_with_probs navíc obsahují pravděpodobnosti příslušnosti každého datového bodu k určitému shluku. Protože nás zajímají dva shluky, pravděpodobnosti blízké 1 odpovídají jednomu shluku a blízké 0 druhému.
Cílem tohoto cvičení je podívat se, jak typická datová sada pro shlukování vypadá před shlukováním i po něm.
Toto cvičení je součástí kurzu
Mixture Models v R
Pokyny k cvičení
- Pomocí funkce
headzobraz prvních 6 pozorování zgender. - Pomocí funkce
headzobraz prvních 6 pozorování zgender_with_probs. - Vytvoř bodový graf s
Weightna ose x aBMIna ose y. Obarvi body podle jejich pravděpodobnosti.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)