Podział danych
W tym ćwiczeniu podzielisz dane na zbiór treningowy i testowy, korzystając z pakietu caret. W kolejnych lekcjach użyjesz zbioru treningowego do budowania modeli regresji logistycznej, a zbioru testowego – do ich walidacji.
To ćwiczenie jest częścią kursu
HR Analytics: Przewidywanie rotacji pracowników w R
Instrukcje do ćwiczenia
- Wczytaj pakiet
caret. - Ustaw ziarno losowości na 567 i utwórz partycję danych, która podzieli zbiór
emp_finalna 70% / 30% (treningowy/testowy). - Utwórz zbiór treningowy, wybierając wiersze o numerach zapisanych w
index_trainze zbioruemp_final. - Przypisz pozostałe obserwacje ze zbioru
emp_finaldo zbioru testowego.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load caret
___
# Set seed of 567
___
# Store row numbers for training dataset: index_train
index_train <- ___(emp_final$turnover, p = ___, list = FALSE)
# Create training dataset: train_set
train_set <- emp_final[___, ]
# Create testing dataset: test_set
test_set <- emp_final[___, ]