探索性別資料
資料集 gender 包含 10,000 人的 Weight、Height 與 BMI 指標。原始資料有 Gender 標籤,其中 5,000 人自我認同為女性,另 5,000 人為男性。這些標籤之後可用來測試分群結果與真實標籤的一致程度。不過,在這個資料集的子集中,並未提供標籤。
資料集 gender_with_probs 也包含每個資料點屬於某個叢集的機率。因為我們關注 2 個叢集,機率接近 1 表示屬於其中一個叢集,接近 0 則表示屬於另一個。
本練習的目標是先快速瀏覽一個典型的分群資料集,在進行分群前與分群後各是什麼樣子。
本練習屬於課程
R 中的混合模型
練習說明
- 使用
head函式查看gender的前 6 筆觀測值。 - 使用
head函式查看gender_with_probs的前 6 筆觀測值。 - 繪製散佈圖,x 軸放
Weight,y 軸放BMI。依據機率為點著色。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)