ÎncepețiÎncepe gratuit

Reesantionarea datelor

Primul pas într-un proiect de învățare automată este crearea seturilor de antrenament și de testare pentru ajustarea și evaluarea modelului. Setul de testare oferă o estimare a performanței modelului pe date noi și ajută la prevenirea supraajustării.

Vei lucra cu setul de date telecom_df, care conține informații despre clienții unei companii de telecomunicații. Variabila de rezultat este canceled_service și înregistrează dacă un client și-a reziliat contractul cu compania. Variabilele predictor conțin informații despre utilizarea telefonului mobil și a internetului de către clienți, precum și despre tipul de contract și tarifele lunare.

Tibble-ul telecom_df a fost încărcat în sesiunea ta.

Acest exercițiu face parte din cursul

Modelare cu tidymodels în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un obiect rsample, telecom_split, care conține instrucțiunile pentru împărțirea aleatorie a datelor telecom_df în seturi de antrenament și de testare.
    • Alocă 75% din date pentru antrenament și stratifică rezultatele după canceled_service.
  • Transmite obiectul telecom_split funcțiilor rsample corespunzătoare pentru a crea seturile de antrenament și de testare.
  • Verifică numărul de rânduri din fiecare set de date transmițându-le funcției nrow().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create data split object
telecom_split <- ___(___, prop = ___,
                     strata = ___)

# Create the training data
telecom_training <- ___ %>% 
  ___

# Create the test data
telecom_test <- ___ %>% 
  ___

# Check the number of rows
nrow(___)
nrow(___)
Editează și rulează codul