Random Forest のハイパーパラメータを探る
どんなハイパーパラメータがあり、それぞれがどのような影響を与えるかを理解することは、データサイエンティストにとって重要なスキルです。モデルが複雑になるほど設定できる項目は増えますが、大きく効くのは一部だけです。
ここでは、既存の Random Forest モデル(ハイパーパラメータの選択がやや良くありません!)を評価し、その後でより良い設定を持つ新しい Random Forest モデルを作成して性能を評価します。
利用できるものは次のとおりです。
X_train、X_test、y_train、y_testの各 DataFrame- 事前に学習済みの Random Forest 推定器
rf_clf_old - テストデータに対する既存の推定器の予測
rf_old_predictions
この演習はコースの一部です
Pythonでのハイパーパラメータチューニング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Print out the old estimator, notice which hyperparameter is badly set
print(____)
# Get confusion matrix & accuracy for the old rf_model
print("Confusion Matrix: \n\n {} \n Accuracy Score: \n\n {}".format(
confusion_matrix(____, ____),
accuracy_score(____, ____)))