НачатьНачать бесплатно

Изучение данных о поле

Набор данных gender содержит показатели Weight (вес), Height (рост) и BMI (индекс массы тела) для 10 000 человек. В исходных данных метка Gender присвоена 5 000 людям, идентифицирующим себя как женщины, и ещё 5 000 — как мужчины. Эти метки пригодятся позже, чтобы оценить качество кластеризации по сравнению с реальными данными. Однако в данном подмножестве датасета метки не предоставлены.

Набор данных gender_with_probs также содержит вероятности принадлежности каждой точки к тому или иному кластеру. Поскольку нас интересуют два кластера, вероятности, близкие к 1, соответствуют одному кластеру, а близкие к 0 — другому.

Цель этого упражнения — посмотреть, как выглядит типичный набор данных для кластеризации до и после её применения.

Это упражнение является частью курса

Смесевые модели в R

Посмотреть курс

Инструкции к упражнению

  • С помощью функции head просмотрите первые 6 наблюдений набора данных gender.
  • С помощью функции head просмотрите первые 6 наблюдений набора данных gender_with_probs.
  • Постройте диаграмму рассеяния, разместив Weight на оси x, а BMI — на оси y. Окрасьте точки в соответствии с их вероятностью.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
Редактировать и запускать код