Explorează datele despre gen
Setul de date gender conține indicii Weight, Height și BMI pentru 10.000 de persoane. Datele originale includ o etichetă Gender pentru 5.000 de persoane care se identifică drept femei și alte 5.000 care se identifică drept bărbați. Aceste etichete vor fi utile mai târziu pentru a testa cât de bine funcționează clusterizarea în raport cu etichetele reale. Totuși, în acest subset al setului de date, etichetele nu sunt furnizate.
Setul de date gender_with_probs conține, în plus, probabilitățile ca fiecare punct de date să aparțină unui cluster. Deoarece ne interesează două clustere, probabilitățile apropiate de 1 corespund unui cluster, iar cele apropiate de 0 celuilalt.
Scopul acestui exercițiu este să arunci o privire asupra modului în care arată un set de date tipic pentru clusterizare, înainte și după aplicarea acesteia.
Acest exercițiu face parte din cursul
Mixture Models în R
Instrucțiuni pentru exercițiu
- Folosește funcția
headpentru a examina primele 6 observații dingender. - Folosește funcția
headpentru a examina primele 6 observații dingender_with_probs. - Creează un scatterplot cu
Weightpe axa x șiBMIpe axa y. Colorează punctele în funcție de probabilitatea lor.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)