Comprobar resultados
En este ejercicio vas a comprobar los resultados de tu modelo de detección de fraude con DBSCAN. En la práctica, a menudo no dispones de etiquetas fiables y es ahí donde un analista de fraude puede ayudarte a validar los resultados. Puede revisar tus resultados y ver si los casos que has marcado son realmente sospechosos. También puedes revisar casos conocidos históricamente de fraude y comprobar si tu modelo los señala.
En este caso, usarás las etiquetas de fraude para evaluar los resultados del modelo. Los números de clúster predichos están disponibles en pred_labels, así como las etiquetas originales de fraude en labels.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
- Crea un dataframe que combine los números de clúster con las etiquetas reales. Esto ya está hecho por ti.
- Crea una condición que marque fraude para los tres clústeres más pequeños: clústeres 21, 17 y 9.
- Crea una tabla cruzada a partir de las etiquetas reales de fraude con las nuevas etiquetas de fraude predichas.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Create a dataframe of the predicted cluster numbers and fraud labels
df = pd.DataFrame({'clusternr':pred_labels,'fraud':labels})
# Create a condition flagging fraud for the smallest clusters
df['predicted_fraud'] = np.where((df['clusternr']==21)|(____)|(____),1 , 0)
# Run a crosstab on the results
print(pd.crosstab(df['fraud'], df['____'], rownames=['Actual Fraud'], colnames=['Flagged Fraud']))