開始使用免費開始

目標變數值的分佈

在產生訓練與測試資料集時,依目標變數進行分層,可以確保兩個資料集中的目標變數值範圍相近。

由於原始資料是隨機切分的,分層能避免把 home_sales 中所有昂貴的房屋都分到測試資料集。否則模型多半會表現不佳,因為它只在較便宜的房屋上受過訓練。

在這個練習中,你會計算訓練與測試資料集中 selling_price 變數的摘要統計量。home_traininghome_test 這兩個 tibble 已從前一個練習載入。

本練習屬於課程

在 R 中使用 tidymodels 建立模型

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Distribution of selling_price in training data
___ %>% 
  summarize(min_sell_price = ___,
            max_sell_price = ___,
            mean_sell_price = ___,
            sd_sell_price = ___)
編輯並執行程式碼