开始使用免费开始使用

决策树

在前面 3 个章节中,您已经学习了多种技术,帮助您应对机器学习面试中的诸多环节。本章将向您介绍多种方法,确保在机器学习面试中被要求创建或讨论的任何模型都具备良好的泛化能力、得到正确评估,并能在多种候选模型中被恰当选型。

在本练习中,您将针对 loan_data 数据集上的决策树进行超参数调优。 这里您将调优 min_samples_split(创建额外二叉划分所需的最小样本数)和 max_depth(树的最大深度)。树越深,划分越多,因此能捕获到关于数据的更多信息。

特征矩阵 X 和目标标签 y 已为您导入。

请注意,您再次完整执行了机器学习流水线中的所有步骤!

Machine learning pipeline

本练习是课程的一部分

用 Python 练习机器学习面试题

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import modules
from sklearn.tree import ____
from sklearn.metrics import accuracy_score

# Train/test split
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=0.30, random_state=123)

# Instantiate, Fit, Predict
loans_clf = ____() 
loans_clf.____(____, ____)
y_pred = loans_clf.____(____)

# Evaluation metric
print("Decision Tree Accuracy: {}".format(____(____,____)))
编辑并运行代码