Kom igångKom igång gratis

Kontrollera förhållandet mellan bedrägeri och icke-bedrägeri

I det här kapitlet arbetar du med creditcard_sampledata.csv, en datamängd som innehåller data om kreditkortstransaktioner. Bedrägerier utgör lyckligtvis en extrem minoritet av dessa transaktioner.

Maskininlärningsalgoritmer fungerar dock vanligtvis bäst när de olika klasserna i datamängden är ungefär lika representerade. Om det finns få bedrägerifall finns det lite data att lära sig identifiera dem utifrån. Det här kallas klassobalans och är en av de största utmaningarna inom bedrägeridetektion.

Låt oss utforska den här datamängden och studera problemet med klassobalans.

Den här övningen är en del av kursen

Bedrägeridetektering i Python

Visa kurs

Övningsinstruktioner

  • Importera pandas som pd och läs in kreditkortsdata, sedan tilldela den till df. Det här är redan gjort åt dig.
  • Använd .info() för att skriva ut information om df.
  • Använd .value_counts() för att räkna bedrägliga och icke-bedrägliga transaktioner i kolumnen 'Class'. Tilldela resultatet till occ.
  • Beräkna andelen bedrägliga transaktioner av det totala antalet transaktioner i datamängden.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import pandas and read csv
import pandas as pd
df = pd.read_csv("creditcard_data.csv")

# Explore the features available in your dataframe
print(df.____)

# Count the occurrences of fraud and no fraud and print them
occ = df['____'].____()
print(occ)

# Print the ratio of fraud cases
print(occ / ____)
Redigera och kör kod