用统计方法界定正常行为
在前面的练习中,我们看到欺诈更常发生在某些交易类别中,但没有明显的方法把数据按年龄段等进行分组。这一次,让我们比较正常交易与欺诈交易的平均支出金额。这样可以帮助您了解,与正常交易相比,欺诈交易在结构上有何不同。
本练习是课程的一部分
Python 中的欺诈检测
练习说明
- 使用
.loc在df中按条件定位,从欺诈与非欺诈观测分别创建两个新的数据框。创建新数据框时,分别指定条件为"fraud 等于 1"和"fraud 等于 0"。 - 在直方图绘图函数中绘制新数据框的
amount列,并分别将图的标签设为fraud和nonfraud。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create two dataframes with fraud and non-fraud data
df_fraud = df.____[df.____ == ____]
df_non_fraud = df.____[df.____ == ____]
# Plot histograms of the amounts in fraud and non-fraud data
plt.hist(____.____, alpha=0.5, label='____')
plt.hist(____.____, alpha=0.5, label='____')
plt.legend()
plt.show()