Kontrollera förhållandet mellan bedrägeri och icke-bedrägeri
I det här kapitlet arbetar du med creditcard_sampledata.csv, en datamängd som innehåller data om kreditkortstransaktioner. Bedrägerier utgör lyckligtvis en extrem minoritet av dessa transaktioner.
Maskininlärningsalgoritmer fungerar dock vanligtvis bäst när de olika klasserna i datamängden är ungefär lika representerade. Om det finns få bedrägerifall finns det lite data att lära sig identifiera dem utifrån. Det här kallas klassobalans och är en av de största utmaningarna inom bedrägeridetektion.
Låt oss utforska den här datamängden och studera problemet med klassobalans.
Den här övningen är en del av kursen
Bedrägeridetektering i Python
Övningsinstruktioner
- Importera
pandassompdoch läs in kreditkortsdata, sedan tilldela den tilldf. Det här är redan gjort åt dig. - Använd
.info()för att skriva ut information omdf. - Använd
.value_counts()för att räkna bedrägliga och icke-bedrägliga transaktioner i kolumnen'Class'. Tilldela resultatet tillocc. - Beräkna andelen bedrägliga transaktioner av det totala antalet transaktioner i datamängden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import pandas and read csv
import pandas as pd
df = pd.read_csv("creditcard_data.csv")
# Explore the features available in your dataframe
print(df.____)
# Count the occurrences of fraud and no fraud and print them
occ = df['____'].____()
print(occ)
# Print the ratio of fraud cases
print(occ / ____)