Rozdělení dat
Prvním krokem každého projektu strojového učení je vytvoření trénovací a testovací datové sady pro trénování a vyhodnocení modelu. Testovací sada poskytuje odhad toho, jak bude model fungovat na nových datech, a pomáhá předcházet přetrénování.
Budeš pracovat s datovou sadou telecom_df, která obsahuje informace o zákaznících telekomunikační společnosti. Výstupní proměnná canceled_service zaznamenává, zda zákazník zrušil svou smlouvu se společností. Prediktory obsahují informace o využívání mobilního telefonu a internetu, typu smlouvy a měsíčních poplatcích.
Tibble telecom_df je již načten do tvé session.
Toto cvičení je součástí kurzu
Modeling with tidymodels in R
Pokyny k cvičení
- Vytvoř objekt
rsamples názvemtelecom_split, který obsahuje instrukce pro náhodné rozdělení dattelecom_dfna trénovací a testovací sadu.- Přiřaď 75 % dat do trénovací sady a stratifikuj výsledky podle proměnné
canceled_service.
- Přiřaď 75 % dat do trénovací sady a stratifikuj výsledky podle proměnné
- Předej objekt
telecom_splitpříslušným funkcím z balíčkursamplea vytvoř trénovací a testovací datové sady. - Zkontroluj počet řádků v každé sadě tak, že je předáš funkci
nrow().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create data split object
telecom_split <- ___(___, prop = ___,
strata = ___)
# Create the training data
telecom_training <- ___ %>%
___
# Create the test data
telecom_test <- ___ %>%
___
# Check the number of rows
nrow(___)
nrow(___)