Visualiser vos données
D'après l'exercice précédent, nous savons que le ratio d'observations de fraude par rapport aux non-fraudes est très faible. Vous pouvez agir là-dessus, par exemple en ré-échantillonnant vos données, ce qui est expliqué dans la prochaine vidéo.
Dans cet exercice, vous allez examiner les données et visualiser le ratio fraude/non-fraude. C'est toujours un bon point de départ en analytique de la fraude : consultez d'abord vos données avant d'y apporter des changements.
De plus, lorsque vous en discutez avec vos collègues, une image permet souvent de bien montrer que les données sont fortement déséquilibrées.
Créons un graphique pour visualiser le ratio des points de données frauduleux et non frauduleux dans l'ensemble de données df.
La fonction prep_data() est déjà chargée dans votre espace de travail, ainsi que matplotlib.pyplot sous le nom plt.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
Définissez la fonction
plot_data(X, y), qui trace de façon claire l'ensemble de variablesXavec les étiquettesydans un nuage de points. Cela a été fait pour vous.Utilisez la fonction
prep_data()sur votre ensemble de donnéesdfpour créer l'ensemble de variablesXet les étiquettesy.Exécutez la fonction
plot_data()sur les nouveauxXetyafin de visualiser vos résultats.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)