用决策树预测流失
现在,您将基于之前练习中掌握的技能,构建一个更复杂的决策树,添加更多参数来预测客户流失。下一章您会更深入地研究流失预测问题。在这里,您将再次在训练数据上运行决策树分类器,在未见过的(测试)数据上预测流失率,并在两个数据集上评估模型的准确率。
sklearn 库中的 tree 模块,以及 sklearn.metrics 中的 accuracy_score 函数都已为您导入。特征和目标变量也已作为训练数据 train_X、train_Y,以及测试数据 test_X、test_Y 提供。
本练习是课程的一部分
Python 营销中的机器学习
练习说明
- 初始化一个最大深度为 7、使用 gini 准则的决策树。
- 将模型拟合到训练数据。
- 在测试数据集上进行预测。
- 分别打印训练集和测试集的准确率。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Initialize the Decision Tree
clf = tree.DecisionTreeClassifier(max_depth = ___,
criterion = 'gini',
splitter = 'best')
# Fit the model to the training data
clf = clf.___(train_X, train_Y)
# Predict the values on test dataset
pred_Y = clf.___(test_X)
# Print accuracy values
print("Training accuracy: ", np.round(clf.score(train_X, train_Y), 3))
print("Test accuracy: ", np.round(___(test_Y, pred_Y), 3))