Kom igångKom igång gratis

Fördelning av utfallsvariabelns värden

Att stratifiera utifrån utfallsvariabeln när man skapar tränings- och testdatamängder säkerställer att utfallsvariabelns värden har ett liknande intervall i båda datamängderna.

Eftersom ursprungsdata delas upp slumpmässigt förhindrar stratifiering att till exempel alla dyra bostäder i home_sales hamnar i testdatamängden. I så fall skulle modellen troligen prestera dåligt, eftersom den tränades på billigare bostäder.

I den här övningen beräknar du sammanfattande statistik för variabeln selling_price i tränings- och testdatamängderna. Tibblarna home_training och home_test har lästs in från föregående övning.

Den här övningen är en del av kursen

Modellering med tidymodels i R

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Distribution of selling_price in training data
___ %>% 
  summarize(min_sell_price = ___,
            max_sell_price = ___,
            mean_sell_price = ___,
            sd_sell_price = ___)
Redigera och kör kod