CommencezCommencez gratuitement

Utiliser des statistiques pour définir un comportement normal

Dans les exercices précédents, nous avons vu que la fraude est plus fréquente dans certaines catégories de transactions, mais qu'il n'existe pas de façon évidente de segmenter nos données, par exemple par groupes d'âge. Cette fois, examinons les montants moyens dépensés dans les transactions normales par rapport aux transactions frauduleuses. Cela vous donnera une idée de la façon dont les transactions frauduleuses diffèrent structurellement des transactions normales.

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Instructions de l’exercice

  • Créez deux nouveaux dataframes à partir des observations frauduleuses et non frauduleuses. Repérez les données dans df avec .loc et attribuez la condition « where fraud is 1 » et « where fraud is 0 » pour créer les nouveaux dataframes.
  • Tracez la colonne amount des nouveaux dataframes dans les fonctions de tracé d'histogramme et attribuez respectivement les étiquettes fraud et nonfraud aux graphiques.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create two dataframes with fraud and non-fraud data 
df_fraud = df.____[df.____ == ____] 
df_non_fraud = df.____[df.____ == ____]

# Plot histograms of the amounts in fraud and non-fraud data 
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()
Modifier et exécuter le code