重新抽樣 NHANES 資料
NHANES 資料是針對抽樣單位(個人)所收集,這些人是特別挑選來代表美國人口。不過,我們來用不同方式重新抽樣 nhanes_final 資料集,讓你熟悉不同的抽樣方法。
我們可以使用 dplyr 的 slice_sample() 進行單純隨機抽樣。它的輸入是資料集與要抽樣的列數(整數)。
分層抽樣可以透過結合 group_by() 與 slice_sample() 來完成。這個函式會從 group_by() 指定的每個群組中各自抽取 n 筆樣本。
sampling 套件的 cluster() 會建立叢集抽樣。它需要傳入資料集名稱、要作為叢集變數的變數(以字串名稱的向量傳入,例如 c("variable"))、要選取的叢集數量,以及抽樣方法。
本練習屬於課程
R 的實驗設計
練習說明
- 使用
slice_sample()從nhanes_final抽取 2500 筆觀測值,並存成nhanes_srs。 - 使用
group_by()與slice_sample()建立nhanes_stratified。以riagendr分層,並為每個性別各選取 2000 筆。用count()檢查nhanes_stratified的性別變數,確認是否正確。 - 載入
sampling套件。使用cluster()依"indhhin2"將nhanes_final分成 6 個叢集,方法使用"srswor"。將結果指定給nhanes_cluster。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Use slice_sample() to create nhanes_srs
nhanes_srs <- ___ %>% ___(n=___)
# Create nhanes_stratified with group_by() and slice_sample()
___ <- ___ %>% group_by(___) %>% ___(n=___)
nhanes_stratified %>% ___
# Load sampling package and create nhanes_cluster with cluster()
___
nhanes_cluster <- cluster(___, "___", 6, method = "srswor")