Rozdělení dat
V tomto cvičení rozdělíš data na trénovací a testovací sadu pomocí balíčku caret. V následujících lekcích použiješ trénovací sadu k sestavení logistických regresních modelů a testovací sadu k jejich ověření.
Toto cvičení je součástí kurzu
HR Analytics: Predicting Employee Churn in R
Pokyny k cvičení
- Načti balíček
caret. - Nastav seed na hodnotu 567 a vytvoř datový oddíl, který rozdělí dataset
emp_finalv poměru 70 % / 30 % na trénovací a testovací část. - Vytvoř trénovací dataset výběrem čísel řádků uložených v
index_trainz datasetuemp_final. - Přiřaď zbývající pozorování z
emp_finaldo testovací sady.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load caret
___
# Set seed of 567
___
# Store row numbers for training dataset: index_train
index_train <- ___(emp_final$turnover, p = ___, list = FALSE)
# Create training dataset: train_set
train_set <- emp_final[___, ]
# Create testing dataset: test_set
test_set <- emp_final[___, ]