目標變數值的分佈
在產生訓練與測試資料集時,依目標變數進行分層,可以確保兩個資料集中的目標變數值範圍相近。
由於原始資料是隨機切分的,分層能避免把 home_sales 中所有昂貴的房屋都分到測試資料集。否則模型多半會表現不佳,因為它只在較便宜的房屋上受過訓練。
在這個練習中,你會計算訓練與測試資料集中 selling_price 變數的摘要統計量。home_training 與 home_test 這兩個 tibble 已從前一個練習載入。
本練習屬於課程
在 R 中使用 tidymodels 建立模型
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Distribution of selling_price in training data
___ %>%
summarize(min_sell_price = ___,
max_sell_price = ___,
mean_sell_price = ___,
sd_sell_price = ___)