开始使用免费开始使用

结局变量取值的分布

在生成训练集和测试集时按结局变量进行分层,可以确保两个数据集中结局变量的取值范围相近。

由于原始数据是随机划分的,分层可以避免把 home_sales 中所有高价房都恰好分到测试集中。例如,在这种情况下,模型更可能表现较差,因为它只在价格较低的房屋上进行了训练。

在本练习中,您将计算训练集和测试集中 selling_price 变量的汇总统计量。home_traininghome_test 两个 tibble 已从上一个练习中加载。

本练习是课程的一部分

在 R 中使用 tidymodels 建模

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Distribution of selling_price in training data
___ %>% 
  summarize(min_sell_price = ___,
            max_sell_price = ___,
            mean_sell_price = ___,
            sd_sell_price = ___)
编辑并运行代码