ÎncepețiÎncepe gratuit

Explorează datele despre gen

Setul de date gender conține indicii Weight, Height și BMI pentru 10.000 de persoane. Datele originale includ o etichetă Gender pentru 5.000 de persoane care se identifică drept femei și alte 5.000 care se identifică drept bărbați. Aceste etichete vor fi utile mai târziu pentru a testa cât de bine funcționează clusterizarea în raport cu etichetele reale. Totuși, în acest subset al setului de date, etichetele nu sunt furnizate.

Setul de date gender_with_probs conține, în plus, probabilitățile ca fiecare punct de date să aparțină unui cluster. Deoarece ne interesează două clustere, probabilitățile apropiate de 1 corespund unui cluster, iar cele apropiate de 0 celuilalt.

Scopul acestui exercițiu este să arunci o privire asupra modului în care arată un set de date tipic pentru clusterizare, înainte și după aplicarea acesteia.

Acest exercițiu face parte din cursul

Mixture Models în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește funcția head pentru a examina primele 6 observații din gender.
  • Folosește funcția head pentru a examina primele 6 observații din gender_with_probs.
  • Creează un scatterplot cu Weight pe axa x și BMI pe axa y. Colorează punctele în funcție de probabilitatea lor.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
Editează și rulează codul