Usar estadística para definir el comportamiento normal
En los ejercicios anteriores vimos que el fraude es más frecuente en ciertas categorías de transacciones, pero que no hay una forma obvia de segmentar los datos, por ejemplo, por grupos de edad. Esta vez, vamos a investigar los importes medios gastados en transacciones normales frente a transacciones fraudulentas. Esto te dará una idea de cómo las transacciones fraudulentas difieren estructuralmente de las normales.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
- Crea dos dataframes nuevos a partir de las observaciones de fraude y de no fraude. Localiza los datos en
dfcon.locy asigna la condición "donde fraud es 1" y "donde fraud es 0" para crear los nuevos dataframes. - Representa la columna
amountde los dataframes recién creados en funciones de histograma y asigna las etiquetasfraudynonfraudrespectivamente a los gráficos.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Create two dataframes with fraud and non-fraud data
df_fraud = df.____[df.____ == ____]
df_non_fraud = df.____[df.____ == ____]
# Plot histograms of the amounts in fraud and non-fraud data
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()