Začněte nyníZačněte zdarma

Rozložení hodnot výstupní proměnné

Stratifikace podle výstupní proměnné při vytváření trénovací a testovací sady zajišťuje, že hodnoty výstupní proměnné mají v obou sadách podobné rozpětí.

Protože jsou původní data rozdělena náhodně, stratifikace zabraňuje tomu, aby se například všechny dražší nemovitosti z home_sales ocitly pouze v testovací sadě. V takovém případě by model pravděpodobně fungoval špatně, protože byl trénován na levnějších nemovitostech.

V tomto cvičení vypočítáš souhrnné statistiky pro proměnnou selling_price v trénovací a testovací sadě. Tibbles home_training a home_test byly načteny z předchozího cvičení.

Toto cvičení je součástí kurzu

Modeling with tidymodels in R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Distribution of selling_price in training data
___ %>% 
  summarize(min_sell_price = ___,
            max_sell_price = ___,
            mean_sell_price = ___,
            sd_sell_price = ___)
Upravit a spustit kód