CommencezCommencez gratuitement

Vérifier le ratio fraude vs non-fraude

Dans ce chapitre, vous allez travailler avec creditcard_sampledata.csv, un ensemble de données contenant des transactions par carte de crédit. Heureusement, les fraudes constituent une infime minorité parmi ces transactions.

Cependant, les algorithmes de Machine Learning fonctionnent généralement mieux lorsque les différentes classes de l'ensemble de données sont plus ou moins également représentées. S'il y a peu de cas de fraude, il y a peu de données pour apprendre à les identifier. C'est ce qu'on appelle le déséquilibre des classes, et c'est l'un des principaux défis de la détection de la fraude.

Explorons cet ensemble de données et observons ce problème de déséquilibre des classes.

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Instructions de l’exercice

  • Importez pandas sous le nom pd, lisez les données de cartes de crédit et affectez-les à df. Cela a été fait pour vous.
  • Utilisez .info() pour afficher l'information à propos de df.
  • Utilisez .value_counts() pour obtenir le nombre de transactions frauduleuses et non frauduleuses dans la colonne 'Class'. Affectez le résultat à occ.
  • Calculez le ratio de transactions frauduleuses par rapport au nombre total de transactions de l'ensemble de données.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import pandas and read csv
import pandas as pd
df = pd.read_csv("creditcard_data.csv")

# Explore the features available in your dataframe
print(df.____)

# Count the occurrences of fraud and no fraud and print them
occ = df['____'].____()
print(occ)

# Print the ratio of fraud cases
print(occ / ____)
Modifier et exécuter le code