训练/测试集分布
在机器学习面试中,您几乎一定会接触训练数据和测试数据。正如前面所讨论的,如果训练集与测试集的数据分布不一致,模型性能可能会很差。
在本练习中,您将使用 sklearn.model_selection、seaborn 和 matplotlib.pyplot 中的函数,将 loan_data 划分为训练集和测试集,并可视化它们的分布以发现潜在差异。
请注意,seaborn 和 matplotlib.pyplot 已经导入并分别起别名为 sns 和 plt。
当前流水线已包含 Train/Test split:

本练习是课程的一部分
用 Python 练习机器学习面试题
练习说明
- 将
loan_data子集化为仅包含特征Credit Score、Annual Income,以及目标变量Loan Status,并按此顺序排列。 - 对
loan_data进行 80/20 划分,并将结果赋给loan_data_subset。 - 依次为
trainingSet和testSet创建 pairplot,将hue参数设置为目标变量Loan Status。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()