Zacznij terazZacznij za darmo

Ramki danych do walidacji krzyżowej

Masz już wydzieloną część danych jako dane testowe – teraz możesz wykorzystać pozostałą część do znalezienia najlepszego modelu.

W tym ćwiczeniu podzielisz dane treningowe na serię 5 zestawów treningowo-walidacyjnych, korzystając z funkcji vfold_cv() z pakietu rsample.

To ćwiczenie jest częścią kursu

Uczenie maszynowe w tidyverse

Zobacz kurs

Instrukcje do ćwiczenia

  • Na podstawie training_data zbuduj ramkę danych do 5-krotnej walidacji krzyżowej, używając vfold_cv(), i przypisz wynik do cv_split.
  • Przygotuj cv_data, dodając do cv_split dwie nowe kolumny:
    • train: zawierającą treningowe ramki danych, uzyskane przez zmapowanie training() po kolumnie splits.
    • validate: zawierającą walidacyjne ramki danych, uzyskane przez zmapowanie testing() po kolumnie splits.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
Edytuj i uruchom kod