Utiliser des statistiques pour définir un comportement normal
Dans les exercices précédents, nous avons vu que la fraude est plus fréquente dans certaines catégories de transactions, mais qu'il n'existe pas de façon évidente de segmenter nos données, par exemple par groupes d'âge. Cette fois, examinons les montants moyens dépensés dans les transactions normales par rapport aux transactions frauduleuses. Cela vous donnera une idée de la façon dont les transactions frauduleuses diffèrent structurellement des transactions normales.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Créez deux nouveaux dataframes à partir des observations frauduleuses et non frauduleuses. Repérez les données dans
dfavec.locet attribuez la condition « where fraud is 1 » et « where fraud is 0 » pour créer les nouveaux dataframes. - Tracez la colonne
amountdes nouveaux dataframes dans les fonctions de tracé d'histogramme et attribuez respectivement les étiquettesfraudetnonfraudaux graphiques.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create two dataframes with fraud and non-fraud data
df_fraud = df.____[df.____ == ____]
df_non_fraud = df.____[df.____ == ____]
# Plot histograms of the amounts in fraud and non-fraud data
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()