开始使用免费开始使用

可视化您的数据

从上一个练习我们已经知道,欺诈与非欺诈观测的比例非常低。您可以采取一些措施,例如对数据进行重新采样,下一段视频会进行讲解。

在本练习中,您将先查看数据,并可视化欺诈与非欺诈的比例。在开展欺诈分析时,这始终是一个良好的起点:在做任何修改之前,先把数据看清楚。

此外,在与同事沟通时,一张图通常就能清楚地展示我们正面对的是高度不平衡的数据。 让我们为数据集 df 绘制一个图,来可视化欺诈与非欺诈数据点的比例。

函数 prep_data() 已加载到您的工作区,matplotlib.pyplot 也已以 plt 名称导入。

本练习是课程的一部分

Python 中的欺诈检测

查看课程

练习说明

  • 定义 plot_data(X, y) 函数,用散点图清晰地绘制给定的特征集 X 及其标签 y。这一步已为您完成。

  • 在数据集 df 上使用 prep_data() 函数,生成特征集 X 和标签 y

  • 对新得到的 Xy 调用 plot_data() 函数,来可视化结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
	plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
	plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
	plt.legend()
	return plt.show()

# Create X and y from the prep_data function 
X, y = prep_data(____)

# Plot our data by running our plot data function on X and y
____(X, y)
编辑并运行代码