CommencezCommencez gratuitement

Visualiser les grappes

Jusqu'ici, nous avons tout ce qu'il faut pour tracer les observations ainsi que les ellipses qui représentent les grappes.

De plus, si nous voulons attribuer chaque observation à l'une ou l'autre des deux grappes, nous pouvons utiliser la fonction clusters() et comparer les résultats aux étiquettes réelles. Pour rappel, lorsque nous avons utilisé uniquement la variable Weight pour regrouper les données, nous avons correctement prédit 4500 femmes et 4556 hommes. Voyons si nous pouvons mieux séparer les grappes lorsqu'une variable supplémentaire est ajoutée.

Cette activité fait partie du cours

Modèles de mélange en R

Voir le cours

Instructions de l’exercice

  • Utilisez geom_point() pour créer le nuage de points de Weight et BMI. Ajoutez à ce graphique les deux ellipses enregistrées dans ellipses_comp_number avec la fonction geom_path().
  • Attention : transformez d'abord les ellipses en trame de données (data frame).
  • Colorez la grappe 1 en rouge et la grappe 2 en bleu.
  • Calculez le tableau de fréquences entre les étiquettes réelles stockées dans la variable Gender et celles prédites par clusters.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Plot the ellipses
gender %>% 
  ggplot(aes(x = ___, y = ___)) + ___()+
  geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
  geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))
Modifier et exécuter le code