Vérifier le ratio fraude vs non-fraude
Dans ce chapitre, vous allez travailler avec creditcard_sampledata.csv, un ensemble de données contenant des transactions par carte de crédit. Heureusement, les fraudes constituent une infime minorité parmi ces transactions.
Cependant, les algorithmes de Machine Learning fonctionnent généralement mieux lorsque les différentes classes de l'ensemble de données sont plus ou moins également représentées. S'il y a peu de cas de fraude, il y a peu de données pour apprendre à les identifier. C'est ce qu'on appelle le déséquilibre des classes, et c'est l'un des principaux défis de la détection de la fraude.
Explorons cet ensemble de données et observons ce problème de déséquilibre des classes.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Importez
pandassous le nompd, lisez les données de cartes de crédit et affectez-les àdf. Cela a été fait pour vous. - Utilisez
.info()pour afficher l'information à propos dedf. - Utilisez
.value_counts()pour obtenir le nombre de transactions frauduleuses et non frauduleuses dans la colonne'Class'. Affectez le résultat àocc. - Calculez le ratio de transactions frauduleuses par rapport au nombre total de transactions de l'ensemble de données.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import pandas and read csv
import pandas as pd
df = pd.read_csv("creditcard_data.csv")
# Explore the features available in your dataframe
print(df.____)
# Count the occurrences of fraud and no fraud and print them
occ = df['____'].____()
print(occ)
# Print the ratio of fraud cases
print(occ / ____)