意思決定木の森
この演習では、ブートストラップされた Decision Tree、つまり Random Forest を使ってみます。前の演習と同様に、クロスバリデーションでハイパーパラメータをチューニングしたモデルと精度を比較します。
今回は追加で max_features というハイパーパラメータもチューニングします。これは、モデルが使用する特徴量の数を制御するものです。特に指定しない場合は auto がデフォルトになります。面接で覚えておきたいポイントとして、Decision Tree はデフォルトですべての特徴量を考慮しますが、Random Forest は通常、特徴量数の平方根を考慮します。
特徴量行列 X、目的変数 y、および sklearn.model_selection の train_test_split はインポート済みです。
この演習はコースの一部です
Pythonで学ぶMachine Learning面接対策
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import modules
from sklearn.ensemble import ____
from sklearn.metrics import accuracy_score
# Train/test split
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=0.30, random_state=123)
# Instantiate, Fit, Predict
loans_rf = ____()
loans_rf.____(____, ____)
y_pred = loans_rf.____(____)
# Evaluation metric
print("Random Forest Accuracy: {}".format(____(____,____)))