従業員データの分割
データセットの過学習は分析でよく起こる問題です。これは、モデルが作成に用いたデータでは良く動く一方で、その外では汎化できない状態を指します。
この汎化性能を確保するために、学習用とテスト用にデータを分割(train/test split)します。学習用サンプルでモデルを作り、その後テストサンプルで試します。
この演習では、target と features をそれぞれ 75%/25% の割合で学習用とテスト用に分割します。
この演習はコースの一部です
HRアナリティクス:Pythonで従業員離職を予測する
演習の手順
sklearn.model_selectionモジュールからtrain_test_splitをインポートしますtrain_test_split()を使ってデータセットを学習用セットとテスト用セットに分割します- 観測データの 25% をテスト用セットに割り当てます
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____
# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)