从零到精通
您已经掌握了创建模型规范,以及将数据划分为训练集和测试集的技能。 您也知道如何在划分时避免类别不平衡。 现在是时候把上一课所学结合起来,仅使用训练集来构建您的模型了!
您将要搭建一个完整的机器学习流水线。 它包括创建模型规范、将数据划分为训练集和测试集,最后将训练数据拟合到模型上。祝您学习顺利!
本练习是课程的一部分
R 中的树模型机器学习
练习说明
- 创建
diabetes_split,其中训练集包含diabetes全部行的四分之三,且训练集与测试集在outcome变量上的分布相似。 - 使用
rpart引擎为您的模型构建一个决策树规范,并将其保存为tree_spec。 - 使用
diabetes_split的训练数据,以outcome为目标变量、bmi和skin_thickness为自变量,拟合模型model_trained。
交互式实操练习
通过完成这段示例代码来试试这个练习。
set.seed(9)
# Create the balanced data split
diabetes_split <- ___
# Build the specification of the model
tree_spec <- ___ %>%
___ %>%
___
# Train the model
model_trained <- ___ %>%
fit(___,
___)
model_trained