単純無作為抽出
母集団をサンプリングする最も簡単な方法は、すでに見たとおりです。これは「単純無作為抽出」(略して "SRS" と呼ばれることもあります)といい、各行が他のどの行とも同じ確率で選ばれるように、行を1つずつ無作為に選びます。
どの行がサンプルに含まれたかを見やすくするために、サンプルを取る前に行IDの列をデータセットに追加しておくと便利です。
この章では、IBMの架空の従業員離職(attrition)データセットを使ってサンプリング手法を見ていきます。ここでの「attrition」は会社を離れることを意味します。
attrition_pop が利用可能で、dplyr が読み込まれています。
この演習はコースの一部です
Rで学ぶサンプリング
演習の手順
attrition_popデータセットを表示します。ビューワーで中身を確認し、どのような列があるか把握しましょう。- 任意の値で乱数の種を設定します。
- データセットに行ID列を追加し、単純無作為抽出で200行を取得します。
- サンプルデータセット
attrition_sampを表示します。行IDについてどんなことに気づきますか?
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# View the attrition_pop dataset
___
# Set the seed
___
attrition_samp <- attrition_pop %>%
# Add a row ID column
___ %>%
# Get 200 rows using simple random sampling
___
# View the attrition_samp dataset
___