はじめてのパイプライン
あなたの同僚は、与信スコアリングのデータセットに AdaBoostClassifier を使いました。あなたはランダムフォレスト分類器も試してみたいと考えています。この演習では、この分類器をデータに適合させ、AdaBoostClassifier と比較します。過学習を避けるために、必ず学習用/テスト用データに分割してください。データは事前に読み込み済みで、すべての特徴量が数値に変換されています。特徴量は X、ラベルは y として利用できます。RandomForestClassifier モジュールも事前に読み込み済みです。
この演習はコースの一部です
Python で設計する Machine Learning ワークフロー
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Split the data into train and test, with 20% as test
X_train, ____, ____, y_test = train_test_split(
X, y, ____=0.2, random_state=1)