Візуалізуйте кластери
На цьому етапі у нас є все необхідне, щоб побудувати спостереження разом з еліпсами, які представляють кластери.
Також, якщо ми хочемо віднести кожне спостереження до одного з двох кластерів, можна використати функцію clusters() і порівняти результати з реальними мітками. Нагадаємо: коли ми використовували лише змінну Weight для кластеризації даних, ми правильно передбачили 4500 жінок і 4556 чоловіків. Подивімося, чи вдасться краще розділити кластери, якщо додати ще одну змінну.
Ця вправа є частиною курсу
Мішанинні моделі в R
Інструкції до вправи
- Використайте
geom_point()для створення діаграми розсіяння заWeightіBMI. Додайте до цього графіка два еліпси, збережені вellipses_comp_number, за допомогою функціїgeom_path(). - Зверніть увагу, що еліпси потрібно перетворити на датафрейм.
- Розфарбуйте кластер 1 у червоний, а кластер 2 — у синій.
- Оцініть частотну таблицю для реальних міток, що зберігаються у змінній
Gender, порівняно з прогнозованими, оціненими за допомогоюclusters.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Plot the ellipses
gender %>%
ggplot(aes(x = ___, y = ___)) + ___()+
geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))