Визуализация кластеров
На данном этапе у нас есть всё необходимое, чтобы отобразить наблюдения вместе с эллипсами, соответствующими кластерам.
Если нужно отнести каждое наблюдение к одному из двух кластеров, воспользуйтесь функцией clusters() и сравните результаты с реальными метками. Напомним: когда для кластеризации использовалась только переменная Weight, модель верно определила 4500 женщин и 4556 мужчин. Посмотрим, удастся ли лучше разделить кластеры с добавлением ещё одной переменной.
Это упражнение является частью курса
Смесевые модели в R
Инструкции к упражнению
- С помощью
geom_point()постройте диаграмму рассеяния для переменныхWeightиBMI. Добавьте на график два эллипса, сохранённых вellipses_comp_number, используя функциюgeom_path(). - Обратите внимание: эллипсы необходимо предварительно преобразовать в датафрейм.
- Закрасьте кластер 1 красным цветом, а кластер 2 — синим.
- Постройте таблицу частот для реальных меток, хранящихся в переменной
Gender, и предсказанных меток, полученных с помощьюclusters.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Plot the ellipses
gender %>%
ggplot(aes(x = ___, y = ___)) + ___()+
geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))