始める無料で始める

単純無作為抽出

母集団をサンプリングする最も簡単な方法は、すでに見たとおりです。これは「単純無作為抽出」(略して "SRS" と呼ばれることもあります)といい、各行が他のどの行とも同じ確率で選ばれるように、行を1つずつ無作為に選びます。

どの行がサンプルに含まれたかを見やすくするために、サンプルを取る前に行IDの列をデータセットに追加しておくと便利です。

この章では、IBMの架空の従業員離職(attrition)データセットを使ってサンプリング手法を見ていきます。ここでの「attrition」は会社を離れることを意味します。

attrition_pop が利用可能で、dplyr が読み込まれています。

この演習はコースの一部です

Rで学ぶサンプリング

コースを見る

演習の手順

  • attrition_pop データセットを表示します。ビューワーで中身を確認し、どのような列があるか把握しましょう。
  • 任意の値で乱数の種を設定します。
  • データセットに行ID列を追加し、単純無作為抽出で200行を取得します。
  • サンプルデータセット attrition_samp を表示します。行IDについてどんなことに気づきますか?

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# View the attrition_pop dataset
___

# Set the seed
___

attrition_samp <- attrition_pop %>% 
  # Add a row ID column
  ___ %>% 
  # Get 200 rows using simple random sampling
  ___

# View the attrition_samp dataset
___
コードを編集して実行