Métricas de rendimiento para el modelo de RF
En los ejercicios anteriores obtuviste la exactitud de tu modelo de random forest. Esta vez, sabemos que la exactitud puede ser engañosa en detección de fraude. Con datos de fraude muy desbalanceados, la curva AUROC es una métrica de rendimiento más fiable para comparar distintos clasificadores. Además, el informe de clasificación te da la precisión y el recall de tu modelo, mientras que la matriz de confusión muestra cuántos casos de fraude aciertas realmente. Vamos a obtener estas métricas.
Seguirás trabajando con el mismo modelo de random forest del ejercicio anterior. Tu modelo, definido como model = RandomForestClassifier(random_state=5), ya se ha ajustado a los datos de entrenamiento y X_train, y_train, X_test, y_test están disponibles.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
- Importa el informe de clasificación, la matriz de confusión y el ROC score desde
sklearn.metrics. - Obtén las predicciones binarias de tu
modelde random forest ya entrenado. - Obtén las probabilidades predichas ejecutando la función
predict_proba(). - Obtén el informe de clasificación y la matriz de confusión comparando
y_testconpredicted.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Import the packages to get the different performance metrics
from sklearn.metrics import ____, ____, ____
# Obtain the predictions from our random forest model
predicted = model.____(X_test)
# Predict probabilities
probs = ____.____(X_test)
# Print the ROC curve, classification report and confusion matrix
print(____(y_test, probs[:,1]))
print(____(____, predicted))
print(____(____, ____))