将数据划分为训练集与测试集
现在,您已经准备好通过几个简单步骤来构建一个端到端的机器学习模型了!在接下来的章节中,您将更深入地探索建模的细节,但此处先练习并理解关键步骤。
自变量特征已作为一个名为 X 的 pandas DataFrame 为您加载,因变量值已作为一个名为 Y 的 pandas Series 为您加载。
此外,sklearn 库中的 train_test_split 函数也已加载。您现在将创建训练集和测试集,然后确认数据是否被正确拆分。
本练习是课程的一部分
Python 营销中的机器学习
练习说明
- 将
X和Y划分为训练集和测试集,其中 25% 的数据作为测试集。 - 确认训练集只包含原始数据的 75%。
- 确认测试集只包含原始数据的 25%。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)
# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])
# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])