结局变量取值的分布
在生成训练集和测试集时按结局变量进行分层,可以确保两个数据集中结局变量的取值范围相近。
由于原始数据是随机划分的,分层可以避免把 home_sales 中所有高价房都恰好分到测试集中。例如,在这种情况下,模型更可能表现较差,因为它只在价格较低的房屋上进行了训练。
在本练习中,您将计算训练集和测试集中 selling_price 变量的汇总统计量。home_training 和 home_test 两个 tibble 已从上一个练习中加载。
本练习是课程的一部分
在 R 中使用 tidymodels 建模
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Distribution of selling_price in training data
___ %>%
summarize(min_sell_price = ___,
max_sell_price = ___,
mean_sell_price = ___,
sd_sell_price = ___)