EmpezarEmpieza gratis

Usar estadística para definir el comportamiento normal

En los ejercicios anteriores vimos que el fraude es más frecuente en ciertas categorías de transacciones, pero que no hay una forma obvia de segmentar los datos, por ejemplo, por grupos de edad. Esta vez, vamos a investigar los importes medios gastados en transacciones normales frente a transacciones fraudulentas. Esto te dará una idea de cómo las transacciones fraudulentas difieren estructuralmente de las normales.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Crea dos dataframes nuevos a partir de las observaciones de fraude y de no fraude. Localiza los datos en df con .loc y asigna la condición "donde fraud es 1" y "donde fraud es 0" para crear los nuevos dataframes.
  • Representa la columna amount de los dataframes recién creados en funciones de histograma y asigna las etiquetas fraud y nonfraud respectivamente a los gráficos.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Create two dataframes with fraud and non-fraud data 
df_fraud = df.____[df.____ == ____] 
df_non_fraud = df.____[df.____ == ____]

# Plot histograms of the amounts in fraud and non-fraud data 
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()
Editar y ejecutar código