Visualiser les clusters
Jusqu’ici, nous avons tout ce qu’il faut pour tracer les observations ainsi que les ellipses représentant les clusters.
De plus, si vous souhaitez affecter chaque observation à l’un des deux clusters, vous pouvez utiliser la fonction clusters() et comparer les résultats avec les étiquettes réelles. Pour rappel, lorsque nous n’avons utilisé que la variable Weight pour regrouper les données, nous avons correctement prédit 4500 femmes et 4556 hommes. Voyons si nous pouvons mieux séparer les clusters en ajoutant une variable supplémentaire.
Cet exercice fait partie du cours
<cours>Modèles de mélange en R</cours>Instructions de l’exercice
- Utilisez
geom_point()pour réaliser le nuage de points deWeightetBMI. Ajoutez à ce graphique les deux ellipses enregistrées dansellipses_comp_numberavec la fonctiongeom_path(). - Attention, les ellipses doivent être converties en data frame.
- Colorez le cluster 1 en rouge et le cluster 2 en bleu.
- Calculez le tableau de fréquences croisant les étiquettes réelles contenues dans la variable
Genderavec les étiquettes prédites estimées parclusters.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Plot the ellipses
gender %>%
ggplot(aes(x = ___, y = ___)) + ___()+
geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))