开始使用免费开始使用

检查欺诈与非欺诈的比例

在本章中,您将使用 creditcard_sampledata.csv,这是一个包含信用卡交易数据的数据集。幸运的是,欺诈在这些交易中是一个极小的少数

然而,机器学习算法通常在数据集中不同类别大致均衡时效果更好。如果欺诈样本很少,模型就很难学到如何识别它们。这被称为类别不平衡,也是欺诈检测中的主要挑战之一。

让我们来探索这个数据集,并观察这一类别不平衡问题。

本练习是课程的一部分

Python 中的欺诈检测

查看课程

练习说明

  • 导入 pandas 并命名为 pd,读取信用卡数据并赋给 df。这一步已为您完成。
  • 使用 .info() 打印 df 的信息。
  • 使用 .value_counts() 获取 'Class' 列中欺诈与非欺诈交易的计数。将结果赋给 occ
  • 计算数据集中欺诈交易占总交易数的比例。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import pandas and read csv
import pandas as pd
df = pd.read_csv("creditcard_data.csv")

# Explore the features available in your dataframe
print(df.____)

# Count the occurrences of fraud and no fraud and print them
occ = df['____'].____()
print(occ)

# Print the ratio of fraud cases
print(occ / ____)
编辑并运行代码