НачатьНачать бесплатно

Визуализация кластеров

На данном этапе у нас есть всё необходимое, чтобы отобразить наблюдения вместе с эллипсами, соответствующими кластерам.

Если нужно отнести каждое наблюдение к одному из двух кластеров, воспользуйтесь функцией clusters() и сравните результаты с реальными метками. Напомним: когда для кластеризации использовалась только переменная Weight, модель верно определила 4500 женщин и 4556 мужчин. Посмотрим, удастся ли лучше разделить кластеры с добавлением ещё одной переменной.

Это упражнение является частью курса

Смесевые модели в R

Посмотреть курс

Инструкции к упражнению

  • С помощью geom_point() постройте диаграмму рассеяния для переменных Weight и BMI. Добавьте на график два эллипса, сохранённых в ellipses_comp_number, используя функцию geom_path().
  • Обратите внимание: эллипсы необходимо предварительно преобразовать в датафрейм.
  • Закрасьте кластер 1 красным цветом, а кластер 2 — синим.
  • Постройте таблицу частот для реальных меток, хранящихся в переменной Gender, и предсказанных меток, полученных с помощью clusters.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Plot the ellipses
gender %>% 
  ggplot(aes(x = ___, y = ___)) + ___()+
  geom_path(data = data.frame(ellipse_comp_1), aes(x=x,y=y), col = "___") +
  geom_path(data = data.frame(ellipse_comp_2), aes(x=x,y=y), col = "___")
# Check the assignments
table(gender$Gender, clusters(fit_with_cov))
Редактировать и запускать код