Random Forest Classifier - パート1
それでは、最初のランダムフォレスト分類器を作成して、不正検知に取り組みましょう。先ほど計算したおよそ96%のベースライン精度より良い結果を目指します。このモデルは、今後の演習で改良していくための「ベースライン」モデルになります。まずは、データを学習用とテスト用に分割し、Random Forest モデルを定義しましょう。利用できるデータは、特徴量 X とラベル y です。
この演習はコースの一部です
Pythonで学ぶ不正検知
演習の手順
sklearnからランダムフォレスト分類器をインポートします。- 特徴量
Xとラベルyを学習用とテスト用に分割します。テストデータは 30% に設定してください。 - ランダムフォレスト分類器を
modelに代入し、random_stateは 5 のままにします。異なるモデル間で結果を比較できるように、ここでは乱数シードを固定する必要があります。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the random forest model from sklearn
from sklearn.ensemble import ____
# Split your data into training and test set
X_train, X_test, y_train, y_test = ____(____, ____, test_size=____, random_state=0)
# Define the model as the random forest
model = ____(random_state=5)