由多棵决策树组成的森林
在本练习中,您将练习使用通过自助采样(bootstrapping)构建的决策树,也就是 Random Forest。与上一题类似,您还会将它的准确率与通过交叉验证调参后的模型进行比较。
这一次,您还将调优额外的超参数 max_features,它用于控制模型在每次分裂时可使用的特征数量。如果未显式设置,默认值为 auto。面试要点:决策树默认会考虑所有特征,而随机森林通常仅考虑特征数的平方根。
特征矩阵 X、目标标签 y,以及来自 sklearn.model_selection 的 train_test_split 已为您导入。
本练习是课程的一部分
用 Python 练习机器学习面试题
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import modules
from sklearn.ensemble import ____
from sklearn.metrics import accuracy_score
# Train/test split
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=0.30, random_state=123)
# Instantiate, Fit, Predict
loans_rf = ____()
loans_rf.____(____, ____)
y_pred = loans_rf.____(____)
# Evaluation metric
print("Random Forest Accuracy: {}".format(____(____,____)))