检查欺诈与非欺诈的比例
在本章中,您将使用 creditcard_sampledata.csv,这是一个包含信用卡交易数据的数据集。幸运的是,欺诈在这些交易中是一个极小的少数。
然而,机器学习算法通常在数据集中不同类别大致均衡时效果更好。如果欺诈样本很少,模型就很难学到如何识别它们。这被称为类别不平衡,也是欺诈检测中的主要挑战之一。
让我们来探索这个数据集,并观察这一类别不平衡问题。
本练习是课程的一部分
Python 中的欺诈检测
练习说明
- 导入
pandas并命名为pd,读取信用卡数据并赋给df。这一步已为您完成。 - 使用
.info()打印df的信息。 - 使用
.value_counts()获取'Class'列中欺诈与非欺诈交易的计数。将结果赋给occ。 - 计算数据集中欺诈交易占总交易数的比例。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import pandas and read csv
import pandas as pd
df = pd.read_csv("creditcard_data.csv")
# Explore the features available in your dataframe
print(df.____)
# Count the occurrences of fraud and no fraud and print them
occ = df['____'].____()
print(occ)
# Print the ratio of fraud cases
print(occ / ____)