NHANES データの再サンプリング
NHANES のデータは、米国人口を代表するように特別に選ばれた標本単位(人)から収集されています。ここでは、異なるサンプリング手法の感覚をつかむために、nhanes_final データセットをいくつかの方法で再サンプリングしてみましょう。
単純無作為抽出は、dplyr の slice_sample() で実行できます。入力としてデータセットと、サンプリングする行数(整数)を受け取ります。
層化抽出は、group_by() と slice_sample() を組み合わせることで実行できます。group_by() で指定した各グループから n 件ずつ抽出します。
sampling パッケージの cluster() はクラスターサンプルを作成します。データセット名、クラスター変数として用いるセット内の変数(例: c("variable") のように名前を文字列でベクトルにして渡します)、選択するクラスター数、そしてメソッドを指定します。
この演習はコースの一部です
Rで学ぶ実験計画法
演習の手順
slice_sample()を使ってnhanes_finalから 2500 行を抽出し、nhanes_srsとして保存します。group_by()とslice_sample()を使ってnhanes_stratifiedを作成します。riagendrで層化し、各性別から 2000 件ずつ選びます。count()を使ってnhanes_stratifiedの性別変数を確認し、意図どおりになっていることを確かめてください。samplingパッケージを読み込みます。cluster()を使って、nhanes_finalを"indhhin2"で 6 クラスターに分け、メソッドは"srswor"を指定します。結果をnhanes_clusterに代入します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Use slice_sample() to create nhanes_srs
nhanes_srs <- ___ %>% ___(n=___)
# Create nhanes_stratified with group_by() and slice_sample()
___ <- ___ %>% group_by(___) %>% ___(n=___)
nhanes_stratified %>% ___
# Load sampling package and create nhanes_cluster with cluster()
___
nhanes_cluster <- cluster(___, "___", 6, method = "srswor")