CommencerCommencez gratuitement

Visualiser les clusters

Jusqu’ici, nous avons tout ce qu’il faut pour tracer les observations ainsi que les ellipses représentant les clusters.

De plus, si vous souhaitez affecter chaque observation à l’un des deux clusters, vous pouvez utiliser la fonction clusters() et comparer les résultats avec les étiquettes réelles. Pour rappel, lorsque nous n’avons utilisé que la variable Weight pour regrouper les données, nous avons correctement prédit 4500 femmes et 4556 hommes. Voyons si nous pouvons mieux séparer les clusters en ajoutant une variable supplémentaire.

Cet exercice fait partie du cours

<cours>Modèles de mélange en R</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez geom_point() pour réaliser le nuage de points de Weight et BMI. Ajoutez à ce graphique les deux ellipses enregistrées dans ellipses_comp_number avec la fonction geom_path().
  • Attention, les ellipses doivent être converties en data frame.
  • Colorez le cluster 1 en rouge et le cluster 2 en bleu.
  • Calculez le tableau de fréquences croisant les étiquettes réelles contenues dans la variable Gender avec les étiquettes prédites estimées par clusters.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Plot the ellipses
gender %>% 
  ggplot(aes(x = ___, y = ___)) + ___()+
  geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
  geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))
Modifier et exécuter le code