CommencerCommencez gratuitement

Explorer les données de genre

Le jeu de données gender contient le Weight, le Height et l’indice BMI de 10 000 personnes. Les données d’origine comportent une étiquette Gender : 5 000 personnes s’identifient comme femmes et 5 000 comme hommes. Ces étiquettes seront utiles plus tard pour évaluer la qualité du clustering par rapport aux vraies classes. Cependant, dans ce sous-ensemble, les étiquettes ne sont pas fournies.

Le jeu de données gender_with_probs contient également les probabilités d’appartenance de chaque point de données à un cluster. Comme nous nous intéressons à deux clusters, les probabilités proches de 1 renvoient à un cluster et celles proches de 0 à l’autre.

Le but de cet exercice est d’entrevoir à quoi ressemble un jeu de données typique de clustering avant et après l’application du clustering.

Cet exercice fait partie du cours

<cours>Modèles de mélange en R</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez la fonction head pour afficher les 6 premières observations de gender.
  • Utilisez la fonction head pour afficher les 6 premières observations de gender_with_probs.
  • Réalisez un nuage de points avec Weight en abscisse et BMI en ordonnée. Colorez les points selon leur probabilité.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
Modifier et exécuter le code