НачатьНачать бесплатно

Метрики качества модели случайного леса

В предыдущих упражнениях вы получили оценку точности для модели случайного леса. Однако мы знаем, что точность может вводить в заблуждение при обнаружении мошенничества. При сильном дисбалансе классов кривая AUROC является более надёжной метрикой качества и позволяет сравнивать разные классификаторы. Кроме того, отчёт о классификации показывает точность и полноту модели, а матрица ошибок наглядно демонстрирует, сколько мошеннических случаев модель предсказывает верно. Давайте вычислим эти метрики.

Вы продолжаете работать с той же моделью случайного леса из предыдущего упражнения. Модель, определённая как model = RandomForestClassifier(random_state=5), уже обучена на обучающих данных; переменные X_train, y_train, X_test, y_test доступны.

Это упражнение является частью курса

Обнаружение мошенничества на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте отчёт о классификации, матрицу ошибок и ROC-оценку из sklearn.metrics.
  • Получите бинарные предсказания обученной модели случайного леса model.
  • Получите предсказанные вероятности с помощью функции predict_proba().
  • Вычислите отчёт о классификации и матрицу ошибок, сравнив y_test с predicted.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the packages to get the different performance metrics
from sklearn.metrics import ____, ____, ____

# Obtain the predictions from our random forest model 
predicted = model.____(X_test)

# Predict probabilities
probs = ____.____(X_test)

# Print the ROC curve, classification report and confusion matrix
print(____(y_test, probs[:,1]))
print(____(____, predicted))
print(____(____, ____))
Редактировать и запускать код