Rozkład wartości zmiennej wynikowej
Stratyfikacja według zmiennej wynikowej podczas tworzenia zbiorów treningowego i testowego zapewnia, że wartości tej zmiennej mają podobny zakres w obu zbiorach.
Ponieważ dane są dzielone losowo, stratyfikacja pozwala uniknąć sytuacji, w której wszystkie drogie domy ze zbioru home_sales trafiłyby np. wyłącznie do zbioru testowego. W takim przypadku model najprawdopodobniej działałby słabo, ponieważ był trenowany na tańszych nieruchomościach.
W tym ćwiczeniu obliczysz statystyki opisowe dla zmiennej selling_price w zbiorach treningowym i testowym. Ramki danych home_training oraz home_test zostały wczytane z poprzedniego ćwiczenia.
To ćwiczenie jest częścią kursu
Modelowanie z tidymodels w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Distribution of selling_price in training data
___ %>%
summarize(min_sell_price = ___,
max_sell_price = ___,
mean_sell_price = ___,
sd_sell_price = ___)