Kom igångKom igång gratis

Visualisera dina data

Från föregående övning vet vi att andelen bedrägerier jämfört med legitima transaktioner är mycket låg. Det finns sätt att hantera det – till exempel genom omsampling av datan, vilket förklaras i nästa video.

I den här övningen tittar du på datan och visualiserar förhållandet mellan bedrägliga och legitima observationer. Det är alltid ett bra första steg i en bedrägerianalys att granska datan innan du gör några ändringar i den.

När du dessutom diskuterar med kollegor kan en bild snabbt göra det tydligt att vi arbetar med kraftigt obalanserade data. Låt oss skapa ett diagram som visualiserar förhållandet mellan bedrägliga och legitima datapunkter i datamängden df.

Funktionen prep_data() är redan inläst i din arbetsmiljö, liksom matplotlib.pyplot som plt.

Den här övningen är en del av kursen

Bedrägeridetektering i Python

Visa kurs

Övningsinstruktioner

  • Definiera funktionen plot_data(X, y), som ritar upp det angivna särdragsunderlaget X med etiketter y i ett spridningsdiagram. Det här steget är redan klart.

  • Använd funktionen prep_data() på din datamängd df för att skapa särdragsunderlaget X och etiketterna y.

  • Kör funktionen plot_data() på de X- och y-värden du just skapat för att visualisera resultaten.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
	plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
	plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
	plt.legend()
	return plt.show()

# Create X and y from the prep_data function 
X, y = prep_data(____)

# Plot our data by running our plot data function on X and y
____(X, y)
Redigera och kör kod