EmpezarEmpieza gratis

Métricas de rendimiento para el modelo de RF

En los ejercicios anteriores obtuviste la exactitud de tu modelo de random forest. Esta vez, sabemos que la exactitud puede ser engañosa en detección de fraude. Con datos de fraude muy desbalanceados, la curva AUROC es una métrica de rendimiento más fiable para comparar distintos clasificadores. Además, el informe de clasificación te da la precisión y el recall de tu modelo, mientras que la matriz de confusión muestra cuántos casos de fraude aciertas realmente. Vamos a obtener estas métricas.

Seguirás trabajando con el mismo modelo de random forest del ejercicio anterior. Tu modelo, definido como model = RandomForestClassifier(random_state=5), ya se ha ajustado a los datos de entrenamiento y X_train, y_train, X_test, y_test están disponibles.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Importa el informe de clasificación, la matriz de confusión y el ROC score desde sklearn.metrics.
  • Obtén las predicciones binarias de tu model de random forest ya entrenado.
  • Obtén las probabilidades predichas ejecutando la función predict_proba().
  • Obtén el informe de clasificación y la matriz de confusión comparando y_test con predicted.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Import the packages to get the different performance metrics
from sklearn.metrics import ____, ____, ____

# Obtain the predictions from our random forest model 
predicted = model.____(X_test)

# Predict probabilities
probs = ____.____(X_test)

# Print the ROC curve, classification report and confusion matrix
print(____(y_test, probs[:,1]))
print(____(____, predicted))
print(____(____, ____))
Editar y ejecutar código