Začněte nyníZačněte zdarma

Rozdělení dat

Prvním krokem každého projektu strojového učení je vytvoření trénovací a testovací datové sady pro trénování a vyhodnocení modelu. Testovací sada poskytuje odhad toho, jak bude model fungovat na nových datech, a pomáhá předcházet přetrénování.

Budeš pracovat s datovou sadou telecom_df, která obsahuje informace o zákaznících telekomunikační společnosti. Výstupní proměnná canceled_service zaznamenává, zda zákazník zrušil svou smlouvu se společností. Prediktory obsahují informace o využívání mobilního telefonu a internetu, typu smlouvy a měsíčních poplatcích.

Tibble telecom_df je již načten do tvé session.

Toto cvičení je součástí kurzu

Modeling with tidymodels in R

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř objekt rsample s názvem telecom_split, který obsahuje instrukce pro náhodné rozdělení dat telecom_df na trénovací a testovací sadu.
    • Přiřaď 75 % dat do trénovací sady a stratifikuj výsledky podle proměnné canceled_service.
  • Předej objekt telecom_split příslušným funkcím z balíčku rsample a vytvoř trénovací a testovací datové sady.
  • Zkontroluj počet řádků v každé sadě tak, že je předáš funkci nrow().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create data split object
telecom_split <- ___(___, prop = ___,
                     strata = ___)

# Create the training data
telecom_training <- ___ %>% 
  ___

# Create the test data
telecom_test <- ___ %>% 
  ___

# Check the number of rows
nrow(___)
nrow(___)
Upravit a spustit kód