Scikit Learn での GridSearchCV
Scikit Learn の GridSearchCV モジュールには、グリッドサーチを効率的に実行するための便利な機能が多数用意されています。ここでは、指定されたパラメーターで GridSearchCV オブジェクトを作成して、学んだ内容を実践します。
必要なオプションは次のとおりです。
- 分割基準を 'entropy' にした Random Forest 推定器
- 5 分割の交差検証
- ハイパーパラメーター
max_depth(2, 4, 8, 15) とmax_features('auto' と 'sqrt') - モデルの評価には
roc_aucを使用 - 並列処理に 4 コアを使用
- 最良モデルで再学習(refit)し、学習時のスコアも返すこと
X_train、X_test、y_train、y_test の各データセットが利用可能です。
この演習はコースの一部です
Pythonでのハイパーパラメータチューニング
演習の手順
- 上のコンテキストで指定されたとおりに Random Forest の推定器を作成してください。
- 上のコンテキストで指定されたとおりにパラメーターグリッドを作成してください。
- 直前の2つの手順で作成した要素を使い、上のコンテキストに沿って
GridSearchCVオブジェクトを作成してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a Random Forest Classifier with specified criterion
rf_class = RandomForestClassifier(____=____)
# Create the parameter grid
param_grid = {____: ____, ____: ____}
# Create a GridSearchCV object
grid_rf_class = GridSearchCV(
estimator=____,
param_grid=____,
scoring=____,
n_jobs=____,
cv=____,
refit=____, return_train_score=____)
print(grid_rf_class)