Fördelning av utfallsvariabelns värden
Att stratifiera utifrån utfallsvariabeln när man skapar tränings- och testdatamängder säkerställer att utfallsvariabelns värden har ett liknande intervall i båda datamängderna.
Eftersom ursprungsdata delas upp slumpmässigt förhindrar stratifiering att till exempel alla dyra bostäder i home_sales hamnar i testdatamängden. I så fall skulle modellen troligen prestera dåligt, eftersom den tränades på billigare bostäder.
I den här övningen beräknar du sammanfattande statistik för variabeln selling_price i tränings- och testdatamängderna. Tibblarna home_training och home_test har lästs in från föregående övning.
Den här övningen är en del av kursen
Modellering med tidymodels i R
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Distribution of selling_price in training data
___ %>%
summarize(min_sell_price = ___,
max_sell_price = ___,
mean_sell_price = ___,
sd_sell_price = ___)