Ramki danych do walidacji krzyżowej
Masz już wydzieloną część danych jako dane testowe – teraz możesz wykorzystać pozostałą część do znalezienia najlepszego modelu.
W tym ćwiczeniu podzielisz dane treningowe na serię 5 zestawów treningowo-walidacyjnych, korzystając z funkcji vfold_cv() z pakietu rsample.
To ćwiczenie jest częścią kursu
Uczenie maszynowe w tidyverse
Instrukcje do ćwiczenia
- Na podstawie
training_datazbuduj ramkę danych do 5-krotnej walidacji krzyżowej, używającvfold_cv(), i przypisz wynik docv_split. - Przygotuj
cv_data, dodając docv_splitdwie nowe kolumny:train: zawierającą treningowe ramki danych, uzyskane przez zmapowanietraining()po kolumniesplits.validate: zawierającą walidacyjne ramki danych, uzyskane przez zmapowanietesting()po kolumniesplits.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)