Rozložení hodnot výstupní proměnné
Stratifikace podle výstupní proměnné při vytváření trénovací a testovací sady zajišťuje, že hodnoty výstupní proměnné mají v obou sadách podobné rozpětí.
Protože jsou původní data rozdělena náhodně, stratifikace zabraňuje tomu, aby se například všechny dražší nemovitosti z home_sales ocitly pouze v testovací sadě. V takovém případě by model pravděpodobně fungoval špatně, protože byl trénován na levnějších nemovitostech.
V tomto cvičení vypočítáš souhrnné statistiky pro proměnnou selling_price v trénovací a testovací sadě. Tibbles home_training a home_test byly načteny z předchozího cvičení.
Toto cvičení je součástí kurzu
Modeling with tidymodels in R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Distribution of selling_price in training data
___ %>%
summarize(min_sell_price = ___,
max_sell_price = ___,
mean_sell_price = ___,
sd_sell_price = ___)