開始使用免費開始

探索性別資料

資料集 gender 包含 10,000 人的 WeightHeightBMI 指標。原始資料有 Gender 標籤,其中 5,000 人自我認同為女性,另 5,000 人為男性。這些標籤之後可用來測試分群結果與真實標籤的一致程度。不過,在這個資料集的子集中,並未提供標籤。

資料集 gender_with_probs 也包含每個資料點屬於某個叢集的機率。因為我們關注 2 個叢集,機率接近 1 表示屬於其中一個叢集,接近 0 則表示屬於另一個。

本練習的目標是先快速瀏覽一個典型的分群資料集,在進行分群前與分群後各是什麼樣子。

本練習屬於課程

R 中的混合模型

檢視課程

練習說明

  • 使用 head 函式查看 gender 的前 6 筆觀測值。
  • 使用 head 函式查看 gender_with_probs 的前 6 筆觀測值。
  • 繪製散佈圖,x 軸放 Weight,y 軸放 BMI。依據機率為點著色。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
編輯並執行程式碼