开始使用免费开始使用

重采样技术

在上一个练习中,您已经看到类别不平衡会如何影响混淆矩阵的结果。本练习中,您将练习重采样技术,探索在类似 loan_data 这样存在类别不平衡的数据集上,不同重采样方式会带来怎样的结果差异。使用 sklearnresample() 函数时,将少数类的行数提升到与多数类匹配称为上采样,而将多数类的行数降到与少数类匹配称为下采样。

您将分别创建 loan_data 数据集的上采样版和下采样版,在两者上都训练逻辑回归模型,并对其进行评估。训练数据及其对应 deny 的标签被子集化为仅包含少数类,而对应 approve 的标签为多数类。

用于进行预测的训练/测试拆分对象已保存为 X_test,可在练习中直接使用。

本练习是课程的一部分

用 Python 练习机器学习面试题

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])

# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False,  n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])
编辑并运行代码