Zacznij terazZacznij za darmo

Tworzenie zbiorów treningowego i testowego

Podział zbioru danych na zbiór treningowy i testowy to ważny krok podczas budowania i oceny modelu klasyfikacyjnego. Zbiór treningowy służy do zbudowania modelu, a zbiór testowy – do oceny jego dokładności predykcyjnej.

W tym ćwiczeniu podzielisz zbiór danych utworzony w poprzednim rozdziale na zbiór treningowy i testowy. Zbiór danych został wczytany do ramki danych df, a ziarno losowości zostało już ustawione, aby zapewnić odtwarzalność wyników. Przypomnij sobie, że w poprzednim filmie wyznaczyliśmy górną granicę rozmiaru zbioru treningowego za pomocą kilku przydatnych funkcji – teraz czas, żebyś zrobił to samodzielnie!

To ćwiczenie jest częścią kursu

Maszyny wektorów nośnych w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyznacz górną granicę liczby wierszy w zbiorze treningowym i zapisz ją w zmiennej sample_size.
  • Utwórz wektor train, w którym zostaną zapisane losowo przypisane obserwacje zbioru treningowego zgodnie z proporcją 80/20.
  • Przypisz wiersze z wektora train do ramki danych trainset, a pozostałe – do ramki danych testset.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))

# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)

# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]
Edytuj i uruchom kod