Дослідіть дані про стать
Дані gender містять Weight, Height і індекс BMI для 10 000 людей. У початкових даних є мітка Gender для 5 000 людей, які ідентифікують себе як жінки, і для інших 5 000 — як чоловіки. Мітки згодяться згодом, щоб перевірити, наскільки добре кластеризація узгоджується з реальними мітками. Однак у цій підмножині набору даних мітки не надано.
Дані gender_with_probs також містять імовірності належності кожного спостереження до кластера. Оскільки нас цікавлять два кластери, імовірності, близькі до 1, відповідають одному кластеру, а близькі до 0 — іншому.
Мета цієї вправи — побачити, як виглядає типовий набір даних для кластеризації до і після кластеризації.
Ця вправа є частиною курсу
Мішанинні моделі в R
Інструкції до вправи
- Використайте функцію
head, щоб переглянути перші 6 спостережень уgender. - Використайте функцію
head, щоб переглянути перші 6 спостережень уgender_with_probs. - Створіть точкову діаграму з
Weightна осі x іBMIна осі y. Розфарбуйте точки за їхньою імовірністю.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)