变化训练集大小
训练集和测试集的大小会影响模型表现。训练数据越多,模型通常学得越好。不过,模型也可能对训练数据过拟合,泛化到新数据的效果不佳。因此,为了正确评估模型的泛化能力,测试数据也需要足够多。结果是,训练集与测试集的划分之间存在重要的平衡与权衡。
到目前为止,您一直使用 70% 的数据用于训练、30% 用于测试。现在我们改为将 80% 的数据用于训练,并评估这会如何改变模型的表现。
本练习是课程的一部分
营销分析:用 Python 预测客户流失
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import train_test_split
from sklearn.model_selection import train_test_split
# Create feature variable
X = telco.drop('Churn', axis=1)
# Create target variable
y = telco['Churn']
# Create training and testing sets
X_train, X_test, y_train, y_test = ____