Använda statistik för att definiera normalt beteende
I de tidigare övningarna såg vi att bedrägeri förekommer oftare i vissa transaktionskategorier, men att det inte finns något uppenbart sätt att segmentera våra data i exempelvis åldersgrupper. Den här gången ska vi undersöka de genomsnittliga beloppen i normala transaktioner jämfört med bedrägerliga transaktioner. Det ger dig en uppfattning om hur bedrägerliga transaktioner strukturellt skiljer sig från normala transaktioner.
Den här övningen är en del av kursen
Bedrägeridetektering i Python
Övningsinstruktioner
- Skapa två nya dataramar från bedrägerliga respektive icke-bedrägerliga observationer. Filtrera data i
dfmed.lococh tilldela villkoret "där fraud är 1" respektive "där fraud är 0" för att skapa de nya dataramarna. - Rita ut kolumnen
amountfrån de nyligen skapade dataramarna i histogramfunktionerna och tilldela etiketternafraudrespektivenonfraudtill diagrammen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create two dataframes with fraud and non-fraud data
df_fraud = df.____[df.____ == ____]
df_non_fraud = df.____[df.____ == ____]
# Plot histograms of the amounts in fraud and non-fraud data
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()