Začněte nyníZačněte zdarma

Rozdělení dat

V tomto cvičení rozdělíš data na trénovací a testovací sadu pomocí balíčku caret. V následujících lekcích použiješ trénovací sadu k sestavení logistických regresních modelů a testovací sadu k jejich ověření.

Toto cvičení je součástí kurzu

HR Analytics: Predicting Employee Churn in R

Zobrazit kurz

Pokyny k cvičení

  • Načti balíček caret.
  • Nastav seed na hodnotu 567 a vytvoř datový oddíl, který rozdělí dataset emp_final v poměru 70 % / 30 % na trénovací a testovací část.
  • Vytvoř trénovací dataset výběrem čísel řádků uložených v index_train z datasetu emp_final.
  • Přiřaď zbývající pozorování z emp_final do testovací sady.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load caret
___

# Set seed of 567
___

# Store row numbers for training dataset: index_train
index_train <- ___(emp_final$turnover, p = ___, list = FALSE)

# Create training dataset: train_set
train_set <- emp_final[___, ]

# Create testing dataset: test_set
test_set <- emp_final[___, ]
Upravit a spustit kód