应用 SMOTE
在本练习中,您将使用 合成少数类过采样技术(SMOTE)对数据进行重新平衡。与 ROS 不同,SMOTE 不会创建观测的完全副本,而是生成与少数类现有观测相似的全新合成样本。因此,SMOTE 比简单复制观测更为先进。让我们将 SMOTE 应用于信用卡数据。
数据集 df 已可用,所需的 SMOTE 相关包也已导入。在接下来的练习中,您将把结果可视化并与原始数据进行比较,从而清楚地看到应用 SMOTE 的效果。
本练习是课程的一部分
Python 中的欺诈检测
练习说明
- 对
df使用prep_data函数,创建特征X和标签y。 - 将常规 SMOTE 定义为重采样方法,并赋值给变量
method。 - 在原始的
X和y上使用.fit_resample()获取新的重采样数据。 - 使用
plot_data()函数绘制重采样后的数据。
交互式实操练习
通过完成这段示例代码来试试这个练习。
from imblearn.over_sampling import SMOTE
# Run the prep_data function
X, y = ____(df)
# Define the resampling method
method = ____()
# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)
# Plot the resampled data
plot_data(____, ____)