Explorer les données sur le genre
Les données gender contiennent les indices Weight, Height et BMI de 10 000 personnes. Dans les données originales, l'étiquette Gender indique que 5 000 personnes s'identifient comme femmes et 5 000 comme hommes. Ces étiquettes serviront plus tard à vérifier la performance du regroupement par rapport aux vraies étiquettes. Toutefois, dans cet extrait de l'ensemble de données, les étiquettes ne sont pas fournies.
Les données gender_with_probs contiennent aussi les probabilités d'appartenance de chaque point de données à un groupe. Comme nous nous intéressons à deux groupes, des probabilités proches de 1 renvoient à un groupe et proches de 0 à l'autre.
Le but de cet exercice est de jeter un coup d'œil à l'apparence d'un ensemble de données typique avant et après un regroupement.
Cette activité fait partie du cours
Modèles de mélange en R
Instructions de l’exercice
- Utilisez la fonction
headpour afficher les 6 premières observations degender. - Utilisez la fonction
headpour afficher les 6 premières observations degender_with_probs. - Créez un nuage de points avec
Weightsur l'axe des x etBMIsur l'axe des y. Colorez les points selon leur probabilité.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)