Изучение данных о поле
Набор данных gender содержит показатели Weight (вес), Height (рост) и BMI (индекс массы тела) для 10 000 человек. В исходных данных метка Gender присвоена 5 000 людям, идентифицирующим себя как женщины, и ещё 5 000 — как мужчины. Эти метки пригодятся позже, чтобы оценить качество кластеризации по сравнению с реальными данными. Однако в данном подмножестве датасета метки не предоставлены.
Набор данных gender_with_probs также содержит вероятности принадлежности каждой точки к тому или иному кластеру. Поскольку нас интересуют два кластера, вероятности, близкие к 1, соответствуют одному кластеру, а близкие к 0 — другому.
Цель этого упражнения — посмотреть, как выглядит типичный набор данных для кластеризации до и после её применения.
Это упражнение является частью курса
Смесевые модели в R
Инструкции к упражнению
- С помощью функции
headпросмотрите первые 6 наблюдений набора данныхgender. - С помощью функции
headпросмотрите первые 6 наблюдений набора данныхgender_with_probs. - Постройте диаграмму рассеяния, разместив
Weightна оси x, аBMI— на оси y. Окрасьте точки в соответствии с их вероятностью.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)