Visualiser les grappes
Jusqu'ici, nous avons tout ce qu'il faut pour tracer les observations ainsi que les ellipses qui représentent les grappes.
De plus, si nous voulons attribuer chaque observation à l'une ou l'autre des deux grappes, nous pouvons utiliser la fonction clusters() et comparer les résultats aux étiquettes réelles. Pour rappel, lorsque nous avons utilisé uniquement la variable Weight pour regrouper les données, nous avons correctement prédit 4500 femmes et 4556 hommes. Voyons si nous pouvons mieux séparer les grappes lorsqu'une variable supplémentaire est ajoutée.
Cette activité fait partie du cours
Modèles de mélange en R
Instructions de l’exercice
- Utilisez
geom_point()pour créer le nuage de points deWeightetBMI. Ajoutez à ce graphique les deux ellipses enregistrées dansellipses_comp_numberavec la fonctiongeom_path(). - Attention : transformez d'abord les ellipses en trame de données (data frame).
- Colorez la grappe 1 en rouge et la grappe 2 en bleu.
- Calculez le tableau de fréquences entre les étiquettes réelles stockées dans la variable
Genderet celles prédites parclusters.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Plot the ellipses
gender %>%
ggplot(aes(x = ___, y = ___)) + ___()+
geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))