Метрики качества модели случайного леса
В предыдущих упражнениях вы получили оценку точности для модели случайного леса. Однако мы знаем, что точность может вводить в заблуждение при обнаружении мошенничества. При сильном дисбалансе классов кривая AUROC является более надёжной метрикой качества и позволяет сравнивать разные классификаторы. Кроме того, отчёт о классификации показывает точность и полноту модели, а матрица ошибок наглядно демонстрирует, сколько мошеннических случаев модель предсказывает верно. Давайте вычислим эти метрики.
Вы продолжаете работать с той же моделью случайного леса из предыдущего упражнения. Модель, определённая как model = RandomForestClassifier(random_state=5), уже обучена на обучающих данных; переменные X_train, y_train, X_test, y_test доступны.
Это упражнение является частью курса
Обнаружение мошенничества на Python
Инструкции к упражнению
- Импортируйте отчёт о классификации, матрицу ошибок и ROC-оценку из
sklearn.metrics. - Получите бинарные предсказания обученной модели случайного леса
model. - Получите предсказанные вероятности с помощью функции
predict_proba(). - Вычислите отчёт о классификации и матрицу ошибок, сравнив
y_testсpredicted.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the packages to get the different performance metrics
from sklearn.metrics import ____, ____, ____
# Obtain the predictions from our random forest model
predicted = model.____(X_test)
# Predict probabilities
probs = ____.____(X_test)
# Print the ROC curve, classification report and confusion matrix
print(____(y_test, probs[:,1]))
print(____(____, predicted))
print(____(____, ____))