CommencezCommencez gratuitement

Explorer les données sur le genre

Les données gender contiennent les indices Weight, Height et BMI de 10 000 personnes. Dans les données originales, l'étiquette Gender indique que 5 000 personnes s'identifient comme femmes et 5 000 comme hommes. Ces étiquettes serviront plus tard à vérifier la performance du regroupement par rapport aux vraies étiquettes. Toutefois, dans cet extrait de l'ensemble de données, les étiquettes ne sont pas fournies.

Les données gender_with_probs contiennent aussi les probabilités d'appartenance de chaque point de données à un groupe. Comme nous nous intéressons à deux groupes, des probabilités proches de 1 renvoient à un groupe et proches de 0 à l'autre.

Le but de cet exercice est de jeter un coup d'œil à l'apparence d'un ensemble de données typique avant et après un regroupement.

Cette activité fait partie du cours

Modèles de mélange en R

Voir le cours

Instructions de l’exercice

  • Utilisez la fonction head pour afficher les 6 premières observations de gender.
  • Utilisez la fonction head pour afficher les 6 premières observations de gender_with_probs.
  • Créez un nuage de points avec Weight sur l'axe des x et BMI sur l'axe des y. Colorez les points selon leur probabilité.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
Modifier et exécuter le code