Zacznij terazZacznij za darmo

Rozkład wartości zmiennej wynikowej

Stratyfikacja według zmiennej wynikowej podczas tworzenia zbiorów treningowego i testowego zapewnia, że wartości tej zmiennej mają podobny zakres w obu zbiorach.

Ponieważ dane są dzielone losowo, stratyfikacja pozwala uniknąć sytuacji, w której wszystkie drogie domy ze zbioru home_sales trafiłyby np. wyłącznie do zbioru testowego. W takim przypadku model najprawdopodobniej działałby słabo, ponieważ był trenowany na tańszych nieruchomościach.

W tym ćwiczeniu obliczysz statystyki opisowe dla zmiennej selling_price w zbiorach treningowym i testowym. Ramki danych home_training oraz home_test zostały wczytane z poprzedniego ćwiczenia.

To ćwiczenie jest częścią kursu

Modelowanie z tidymodels w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Distribution of selling_price in training data
___ %>% 
  summarize(min_sell_price = ___,
            max_sell_price = ___,
            mean_sell_price = ___,
            sd_sell_price = ___)
Edytuj i uruchom kod