开始使用免费开始使用

训练/测试集分布

在机器学习面试中,您几乎一定会接触训练数据和测试数据。正如前面所讨论的,如果训练集与测试集的数据分布不一致,模型性能可能会很差。

在本练习中,您将使用 sklearn.model_selectionseabornmatplotlib.pyplot 中的函数,将 loan_data 划分为训练集和测试集,并可视化它们的分布以发现潜在差异。

请注意,seabornmatplotlib.pyplot 已经导入并分别起别名为 snsplt

当前流水线已包含 Train/Test split

Machine learning pipeline

本练习是课程的一部分

用 Python 练习机器学习面试题

查看课程

练习说明

  • loan_data 子集化为仅包含特征 Credit ScoreAnnual Income,以及目标变量 Loan Status,并按此顺序排列。
  • loan_data 进行 80/20 划分,并将结果赋给 loan_data_subset
  • 依次为 trainingSettestSet 创建 pairplot,将 hue 参数设置为目标变量 Loan Status

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
编辑并运行代码