Distribuția valorilor variabilei de rezultat
Stratificarea după variabila de rezultat la generarea seturilor de antrenament și de testare asigură că valorile variabilei de rezultat au un interval similar în ambele seturi de date.
Deoarece datele originale sunt împărțite aleatoriu, stratificarea evită, de exemplu, plasarea tuturor locuințelor scumpe din home_sales în setul de testare. În acest caz, modelul tău ar performa probabil slab, deoarece a fost antrenat pe locuințe mai puțin costisitoare.
În acest exercițiu, vei calcula statistici rezumative pentru variabila selling_price din seturile de antrenament și de testare. Tibble-urile home_training și home_test au fost încărcate din exercițiul anterior.
Acest exercițiu face parte din cursul
Modelare cu tidymodels în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Distribution of selling_price in training data
___ %>%
summarize(min_sell_price = ___,
max_sell_price = ___,
mean_sell_price = ___,
sd_sell_price = ___)