Eksploracja danych dotyczących płci
Zbiór danych gender zawiera wartości Weight (waga), Height (wzrost) oraz indeksy BMI dla 10 000 osób. Oryginalne dane zawierają etykietę Gender dla 5 000 osób identyfikujących się jako kobiety i 5 000 jako mężczyźni. Etykiety te przydadzą się później do oceny, jak dobrze grupowanie wypada w porównaniu z rzeczywistymi przypisaniami. W tym podzbiorze danych etykiety jednak nie są dostępne.
Zbiór danych gender_with_probs zawiera dodatkowo prawdopodobieństwa przynależności każdego punktu do danego skupienia. Ponieważ interesują nas dwa skupienia, wartości bliskie 1 odpowiadają jednemu skupieniu, a bliskie 0 – drugiemu.
Celem tego ćwiczenia jest przyjrzenie się temu, jak typowy zbiór danych do grupowania wygląda przed grupowaniem i po nim.
To ćwiczenie jest częścią kursu
Modele mieszane w R
Instrukcje do ćwiczenia
- Użyj funkcji
head, aby wyświetlić pierwsze 6 obserwacji ze zbiorugender. - Użyj funkcji
head, aby wyświetlić pierwsze 6 obserwacji ze zbiorugender_with_probs. - Utwórz wykres punktowy z
Weightna osi x iBMIna osi y. Pokoloruj punkty według ich prawdopodobieństwa.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)