Kontrola poměru podvodných a legitimních transakcí
V této kapitole budeš pracovat s datastem creditcard_sampledata.csv, který obsahuje data o transakcích kreditními kartami. Podvodné transakce jsou naštěstí v těchto datech naprostou menšinou.
Machine Learning algoritmy ale obvykle fungují nejlépe tehdy, když jsou různé třídy v datasetu zastoupeny přibližně stejnou měrou. Pokud je případů podvodu málo, model má jen omezené množství dat, ze kterých se může naučit, jak je rozpoznat. Tento jev se označuje jako nevyvážení tříd a je jednou z hlavních výzev při odhalování podvodů.
Pojďme tento dataset prozkoumat a podívat se na tento problém nevyvážení tříd zblízka.
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Importuj
pandasjakopda načti data o kreditních kartách do proměnnédf. Tento krok už je hotový. - Pomocí
.info()vypiš informace odf. - Pomocí
.value_counts()zjisti počet podvodných a legitimních transakcí ve sloupci'Class'. Výsledek ulož do proměnnéocc. - Vypočítej podíl podvodných transakcí z celkového počtu transakcí v datasetu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import pandas and read csv
import pandas as pd
df = pd.read_csv("creditcard_data.csv")
# Explore the features available in your dataframe
print(df.____)
# Count the occurrences of fraud and no fraud and print them
occ = df['____'].____()
print(occ)
# Print the ratio of fraud cases
print(occ / ____)