EmpezarEmpieza gratis

Explorar la forma tradicional de detectar fraude

En este ejercicio vas a intentar encontrar casos de fraude en nuestro conjunto de datos de tarjetas de crédito a la "manera antigua". Primero definirás valores umbral usando estadísticas habituales para separar fraude y no fraude. Después, aplica esos umbrales a tus variables para detectar fraude. Esto es una práctica común en los equipos de analítica de fraude.

Los umbrales estadísticos suelen determinarse observando los valores de media de las observaciones. Empecemos este ejercicio comprobando si las medias de las variables difieren entre casos de fraude y de no fraude. Luego, usarás esa información para crear umbrales razonables. Por último, comprobarás qué tal funciona en la detección de fraude.

pandas ya se ha importado como pd.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Usa groupby() para agrupar df por Class y obtener la media de las variables.
  • Crea la condición V1 menor que -3 y V3 menor que -5 como criterio para marcar casos de fraude.
  • Como medida de rendimiento, usa la función crosstab de pandas para comparar nuestros casos marcados como fraude con los casos de fraude reales.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Get the mean for each group
____.____(____).mean()

# Implement a rule for stating which cases are flagged as fraud
df['flag_as_fraud'] = np.where(np.logical_and(______), 1, 0)

# Create a crosstab of flagged fraud cases versus the actual fraud cases
print(____(df.Class, df.flag_as_fraud, rownames=['Actual Fraud'], colnames=['Flagged Fraud']))
Editar y ejecutar código