Explorer les données de genre
Le jeu de données gender contient le Weight, le Height et l’indice BMI de 10 000 personnes. Les données d’origine comportent une étiquette Gender : 5 000 personnes s’identifient comme femmes et 5 000 comme hommes. Ces étiquettes seront utiles plus tard pour évaluer la qualité du clustering par rapport aux vraies classes. Cependant, dans ce sous-ensemble, les étiquettes ne sont pas fournies.
Le jeu de données gender_with_probs contient également les probabilités d’appartenance de chaque point de données à un cluster. Comme nous nous intéressons à deux clusters, les probabilités proches de 1 renvoient à un cluster et celles proches de 0 à l’autre.
Le but de cet exercice est d’entrevoir à quoi ressemble un jeu de données typique de clustering avant et après l’application du clustering.
Cet exercice fait partie du cours
<cours>Modèles de mélange en R</cours>Instructions de l’exercice
- Utilisez la fonction
headpour afficher les 6 premières observations degender. - Utilisez la fonction
headpour afficher les 6 premières observations degender_with_probs. - Réalisez un nuage de points avec
Weighten abscisse etBMIen ordonnée. Colorez les points selon leur probabilité.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)