可视化您的数据
从上一个练习我们已经知道,欺诈与非欺诈观测的比例非常低。您可以采取一些措施,例如对数据进行重新采样,下一段视频会进行讲解。
在本练习中,您将先查看数据,并可视化欺诈与非欺诈的比例。在开展欺诈分析时,这始终是一个良好的起点:在做任何修改之前,先把数据看清楚。
此外,在与同事沟通时,一张图通常就能清楚地展示我们正面对的是高度不平衡的数据。
让我们为数据集 df 绘制一个图,来可视化欺诈与非欺诈数据点的比例。
函数 prep_data() 已加载到您的工作区,matplotlib.pyplot 也已以 plt 名称导入。
本练习是课程的一部分
Python 中的欺诈检测
练习说明
定义
plot_data(X, y)函数,用散点图清晰地绘制给定的特征集X及其标签y。这一步已为您完成。在数据集
df上使用prep_data()函数,生成特征集X和标签y。对新得到的
X和y调用plot_data()函数,来可视化结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)