Tworzenie zbiorów treningowego i testowego
Podział zbioru danych na zbiór treningowy i testowy to ważny krok podczas budowania i oceny modelu klasyfikacyjnego. Zbiór treningowy służy do zbudowania modelu, a zbiór testowy – do oceny jego dokładności predykcyjnej.
W tym ćwiczeniu podzielisz zbiór danych utworzony w poprzednim rozdziale na zbiór treningowy i testowy. Zbiór danych został wczytany do ramki danych df, a ziarno losowości zostało już ustawione, aby zapewnić odtwarzalność wyników. Przypomnij sobie, że w poprzednim filmie wyznaczyliśmy górną granicę rozmiaru zbioru treningowego za pomocą kilku przydatnych funkcji – teraz czas, żebyś zrobił to samodzielnie!
To ćwiczenie jest częścią kursu
Maszyny wektorów nośnych w R
Instrukcje do ćwiczenia
- Wyznacz górną granicę liczby wierszy w zbiorze treningowym i zapisz ją w zmiennej
sample_size. - Utwórz wektor
train, w którym zostaną zapisane losowo przypisane obserwacje zbioru treningowego zgodnie z proporcją 80/20. - Przypisz wiersze z wektora
traindo ramki danychtrainset, a pozostałe – do ramki danychtestset.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))
# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)
# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]