探索性别数据
数据集 gender 包含 10,000 人的 Weight、Height 和 BMI 指标。原始数据有 Gender 标签,其中 5,000 人自我认定为女性,另外 5,000 人为男性。稍后我们会用这些标签来评估聚类与真实标签的一致性。不过,在此数据子集中,并未提供这些标签。
数据集 gender_with_probs 还包含每个数据点属于某个簇的概率。因为我们只考虑两个簇,概率接近 1 表示属于其中一个簇,接近 0 表示属于另一个簇。
本练习旨在让您先了解一个典型的聚类数据集在聚类之前与之后分别是什么样子。
本练习是课程的一部分
R 中的混合模型
练习说明
- 使用函数
head查看gender的前 6 条观测。 - 使用函数
head查看gender_with_probs的前 6 条观测。 - 以
Weight为横轴、BMI为纵轴绘制散点图,并按其概率为点着色。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)