Grid search
Ladění hyperparametrů lze v sklearn provádět zadáním různých vstupních parametrů, které lze zakódovat pomocí různých funkcí z numpy. Jednou z metod ladění je grid search, která vyčerpávajícím způsobem prochází všechny kombinace vstupních hyperparametrů definovaných přes param_grid. V tomto cvičení použiješ grid search k prohledání hyperparametrů ukázkového klasifikátoru Random Forest s hodnotící funkcí AUC křivky ROC.
V pracovním prostoru máš k dispozici X_train, y_train, X_test, y_test. Dostupné jsou také pandas jako pd, numpy jako np a sklearn. Navíc je k dispozici GridSearchCV() z sklearn.model_selection.
Toto cvičení je součástí kurzu
Předpovídání CTR pomocí Machine Learning v Pythonu
Pokyny k cvičení
- Vytvoř seznam hodnot pro každý hyperparametr v
n_estimatorsamax_depth. - Vytvoř klasifikátor Random Forest.
- Nastav grid search tak, aby procházel všechny kombinace hyperparametrů.
- Vypiš nejlepší AUC skóre pomocí
.best_score_a nejlepší estimátor, který k tomuto skóre vedl, pomocí.best_estimator_.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create list of hyperparameters
n_estimators = [10, 50]
max_depth = [5, 20]
param_grid = {'n_estimators': ____, 'max_depth': ____}
# Use Grid search CV to find best parameters
print("starting RF grid search.. ")
rf = ____()
clf = ____(estimator = rf, param_grid = ____, scoring = 'roc_auc')
clf.fit(X_train, y_train)
print("Best Score: ")
print(clf.____)
print("Best Estimator: ")
print(clf.____)