Explorer la méthode traditionnelle pour repérer la fraude
Dans cet exercice, vous allez tenter de trouver des cas de fraude dans notre jeu de données de cartes de crédit à « l'ancienne ». Vous commencerez par définir des valeurs seuils à partir de statistiques courantes pour séparer fraude et non-fraude. Ensuite, appliquez ces seuils à vos variables pour détecter la fraude. C'est une pratique répandue dans les équipes d'analytique de la fraude.
Les seuils statistiques sont souvent déterminés en examinant les valeurs de moyenne des observations. Commençons par vérifier si les moyennes des caractéristiques diffèrent entre les cas de fraude et de non-fraude. Puis, vous utiliserez cette information pour créer des seuils de bon sens. Enfin, vous évaluerez la performance de cette approche pour détecter la fraude.
pandas a déjà été importé sous le nom pd.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Utilisez
groupby()pour regrouperdfselonClasset obtenir la moyenne des caractéristiques. - Créez la condition où
V1est inférieur à -3 etV3est inférieur à -5 pour signaler les cas de fraude. - Comme mesure de performance, utilisez la fonction
crosstabdepandaspour comparer nos cas de fraude signalés aux cas de fraude réels.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Get the mean for each group
____.____(____).mean()
# Implement a rule for stating which cases are flagged as fraud
df['flag_as_fraud'] = np.where(np.logical_and(______), 1, 0)
# Create a crosstab of flagged fraud cases versus the actual fraud cases
print(____(df.Class, df.flag_as_fraud, rownames=['Actual Fraud'], colnames=['Flagged Fraud']))