GridSearchCV для поиска оптимальных параметров
В этом упражнении вы будете настраивать модель более целенаправленно, используя GridSearchCV, который возьмёт на себя всю работу по перебору параметров.
С помощью GridSearchCV вы можете задать метрику качества, по которой будут оцениваться варианты. Поскольку в задачах обнаружения мошенничества главное — выявить как можно больше случаев фрода, вы можете оптимизировать настройки модели для достижения наилучшего показателя полноты (Recall). Если вас также беспокоит количество ложноположительных срабатываний, можно оптимизировать по F1-мере — она обеспечивает баланс между точностью и полнотой.
GridSearchCV уже импортирован из sklearn.model_selection, так что давайте попробуем!
Это упражнение является частью курса
Обнаружение мошенничества на Python
Инструкции к упражнению
- Задайте в сетке параметров перебор 1 и 30 деревьев, а также критериев разбиения
giniиentropy. - Определите модель как простой
RandomForestClassifier, оставивrandom_state=5, чтобы результаты можно было сравнивать. - Задайте параметр
scoringтак, чтобы оптимизация выполнялась по полноте (recall). - Обучите модель на данных
X_trainиy_trainи получите наилучшие параметры модели.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define the parameter sets to test
param_grid = {'n_estimators': [____, ____], 'max_features': ['auto', 'log2'], 'max_depth': [4, 8], 'criterion': ['____', '____']
}
# Define the model to use
model = ____(random_state=5)
# Combine the parameter sets with the defined model
CV_model = GridSearchCV(estimator=model, param_grid=param_grid, cv=5, scoring='____', n_jobs=-1)
# Fit the model to our training data and obtain best parameters
CV_model.fit(____, ____)
CV_model.____