Vérifier les résultats
Dans cet exercice, vous allez vérifier les résultats de votre modèle de détection de fraude DBSCAN. En réalité, on n'a souvent pas d'étiquettes fiables, et c'est là qu'un analyste de la fraude peut vous aider à valider les résultats. Il ou elle peut examiner vos résultats et voir si les cas que vous avez signalés semblent effectivement suspects. Vous pouvez aussi vérifier des cas historiquement connus de fraude et voir si votre modèle les signale.
Ici, vous allez utiliser les étiquettes de fraude pour vérifier les résultats de votre modèle. Les numéros de groupes prédits sont accessibles dans pred_labels, ainsi que les étiquettes de fraude originales dans labels.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Créez un dataframe combinant les numéros de groupes et les étiquettes réelles. Cela a déjà été fait pour vous.
- Créez une condition qui signale une fraude pour les trois plus petits groupes : les groupes 21, 17 et 9.
- Créez une table croisée à partir des étiquettes de fraude réelles et des nouvelles étiquettes de fraude prédites.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a dataframe of the predicted cluster numbers and fraud labels
df = pd.DataFrame({'clusternr':pred_labels,'fraud':labels})
# Create a condition flagging fraud for the smallest clusters
df['predicted_fraud'] = np.where((df['clusternr']==21)|(____)|(____),1 , 0)
# Run a crosstab on the results
print(pd.crosstab(df['fraud'], df['____'], rownames=['Actual Fraud'], colnames=['Flagged Fraud']))