ПочатиПочніть безкоштовно

Дослідіть дані про стать

Дані gender містять Weight, Height і індекс BMI для 10 000 людей. У початкових даних є мітка Gender для 5 000 людей, які ідентифікують себе як жінки, і для інших 5 000 — як чоловіки. Мітки згодяться згодом, щоб перевірити, наскільки добре кластеризація узгоджується з реальними мітками. Однак у цій підмножині набору даних мітки не надано.

Дані gender_with_probs також містять імовірності належності кожного спостереження до кластера. Оскільки нас цікавлять два кластери, імовірності, близькі до 1, відповідають одному кластеру, а близькі до 0 — іншому.

Мета цієї вправи — побачити, як виглядає типовий набір даних для кластеризації до і після кластеризації.

Ця вправа є частиною курсу

Мішанинні моделі в R

Переглянути курс

Інструкції до вправи

  • Використайте функцію head, щоб переглянути перші 6 спостережень у gender.
  • Використайте функцію head, щоб переглянути перші 6 спостережень у gender_with_probs.
  • Створіть точкову діаграму з Weight на осі x і BMI на осі y. Розфарбуйте точки за їхньою імовірністю.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
Редагувати та запускати код