Visualisera dina data
Från föregående övning vet vi att andelen bedrägerier jämfört med legitima transaktioner är mycket låg. Det finns sätt att hantera det – till exempel genom omsampling av datan, vilket förklaras i nästa video.
I den här övningen tittar du på datan och visualiserar förhållandet mellan bedrägliga och legitima observationer. Det är alltid ett bra första steg i en bedrägerianalys att granska datan innan du gör några ändringar i den.
När du dessutom diskuterar med kollegor kan en bild snabbt göra det tydligt att vi arbetar med kraftigt obalanserade data.
Låt oss skapa ett diagram som visualiserar förhållandet mellan bedrägliga och legitima datapunkter i datamängden df.
Funktionen prep_data() är redan inläst i din arbetsmiljö, liksom matplotlib.pyplot som plt.
Den här övningen är en del av kursen
Bedrägeridetektering i Python
Övningsinstruktioner
Definiera funktionen
plot_data(X, y), som ritar upp det angivna särdragsunderlagetXmed etiketteryi ett spridningsdiagram. Det här steget är redan klart.Använd funktionen
prep_data()på din datamängddfför att skapa särdragsunderlagetXoch etiketternay.Kör funktionen
plot_data()på deX- ochy-värden du just skapat för att visualisera resultaten.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)