マスターデータの概要
ここまでで、元のデータセットに rating と survey の情報を結合しました。
さらに、compensation、no_leaves_taken(取得した休暇日数)、hiring_source などの従業員関連情報を追加したデータセット org_final を用意しています。次の章で特徴量エンジニアリングに進む前に、このデータセットを確認しておきましょう。
この演習はコースの一部です
HRアナリティクス:Rで社員離職を予測する
演習の手順
glimpse()を使って、org_finalデータセットの構造を確認します。org_finalデータセットの変数数をvariablesに代入します。ActiveとInactiveの従業員それぞれについて、distance_from_homeの分布を可視化する箱ひげ図を作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# View the structure of the dataset
___
# Number of variables in the dataset
variables <- ___
# Compare the travel distance of Active and Inactive employees
ggplot(org_final, aes(x = ___, y = ___)) +
___