Reesantionarea datelor
Primul pas într-un proiect de învățare automată este crearea seturilor de antrenament și de testare pentru ajustarea și evaluarea modelului. Setul de testare oferă o estimare a performanței modelului pe date noi și ajută la prevenirea supraajustării.
Vei lucra cu setul de date telecom_df, care conține informații despre clienții unei companii de telecomunicații. Variabila de rezultat este canceled_service și înregistrează dacă un client și-a reziliat contractul cu compania. Variabilele predictor conțin informații despre utilizarea telefonului mobil și a internetului de către clienți, precum și despre tipul de contract și tarifele lunare.
Tibble-ul telecom_df a fost încărcat în sesiunea ta.
Acest exercițiu face parte din cursul
Modelare cu tidymodels în R
Instrucțiuni pentru exercițiu
- Creează un obiect
rsample,telecom_split, care conține instrucțiunile pentru împărțirea aleatorie a datelortelecom_dfîn seturi de antrenament și de testare.- Alocă 75% din date pentru antrenament și stratifică rezultatele după
canceled_service.
- Alocă 75% din date pentru antrenament și stratifică rezultatele după
- Transmite obiectul
telecom_splitfuncțiilorrsamplecorespunzătoare pentru a crea seturile de antrenament și de testare. - Verifică numărul de rânduri din fiecare set de date transmițându-le funcției
nrow().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create data split object
telecom_split <- ___(___, prop = ___,
strata = ___)
# Create the training data
telecom_training <- ___ %>%
___
# Create the test data
telecom_test <- ___ %>%
___
# Check the number of rows
nrow(___)
nrow(___)