Začněte nyníZačněte zdarma

Kontrola poměru podvodných a legitimních transakcí

V této kapitole budeš pracovat s datastem creditcard_sampledata.csv, který obsahuje data o transakcích kreditními kartami. Podvodné transakce jsou naštěstí v těchto datech naprostou menšinou.

Machine Learning algoritmy ale obvykle fungují nejlépe tehdy, když jsou různé třídy v datasetu zastoupeny přibližně stejnou měrou. Pokud je případů podvodu málo, model má jen omezené množství dat, ze kterých se může naučit, jak je rozpoznat. Tento jev se označuje jako nevyvážení tříd a je jednou z hlavních výzev při odhalování podvodů.

Pojďme tento dataset prozkoumat a podívat se na tento problém nevyvážení tříd zblízka.

Toto cvičení je součástí kurzu

Detekce podvodů v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj pandas jako pd a načti data o kreditních kartách do proměnné df. Tento krok už je hotový.
  • Pomocí .info() vypiš informace o df.
  • Pomocí .value_counts() zjisti počet podvodných a legitimních transakcí ve sloupci 'Class'. Výsledek ulož do proměnné occ.
  • Vypočítej podíl podvodných transakcí z celkového počtu transakcí v datasetu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import pandas and read csv
import pandas as pd
df = pd.read_csv("creditcard_data.csv")

# Explore the features available in your dataframe
print(df.____)

# Count the occurrences of fraud and no fraud and print them
occ = df['____'].____()
print(occ)

# Print the ratio of fraud cases
print(occ / ____)
Upravit a spustit kód