始める無料で始める

従業員データの分割

データセットの過学習は分析でよく起こる問題です。これは、モデルが作成に用いたデータでは良く動く一方で、その外では汎化できない状態を指します。

この汎化性能を確保するために、学習用とテスト用にデータを分割(train/test split)します。学習用サンプルでモデルを作り、その後テストサンプルで試します。

この演習では、targetfeatures をそれぞれ 75%/25% の割合で学習用とテスト用に分割します。

この演習はコースの一部です

HRアナリティクス:Pythonで従業員離職を予測する

コースを見る

演習の手順

  • sklearn.model_selection モジュールから train_test_split をインポートします
  • train_test_split() を使ってデータセットを学習用セットとテスト用セットに分割します
  • 観測データの 25% をテスト用セットに割り当てます

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
コードを編集して実行