Împărțirea în seturi de antrenament și testare
Într-un flux de lucru disciplinat de învățare automată, este esențial să reții o parte din date (datele de testare) în afara oricărui proces de decizie. Astfel, poți evalua independent performanța modelului tău după ce acesta este finalizat. Restul datelor, datele de antrenament, sunt folosite pentru a construi și a selecta cel mai bun model.
În acest exercițiu, vei folosi pachetul rsample pentru a împărți datele și a realiza separarea inițială în set de antrenament și set de testare pentru datele tale gapminder.
Notă: Deoarece această împărțire este aleatorie, este recomandat să setezi un seed înainte de a o realiza.
Acest exercițiu face parte din cursul
Machine Learning în Tidyverse
Instrucțiuni pentru exercițiu
- Împarte datele în 75% antrenament și 25% testare folosind funcția
initial_split()și atribuie rezultatul variabileigap_split. - Extrage setul de date de antrenament din
gap_splitfolosind funcțiatraining(). - Extrage setul de date de testare din
gap_splitfolosind funcțiatesting(). - Verifică dimensiunile noilor seturi de date folosind funcția
dim()petraining_datașitesting_data, pentru a te asigura că sunt cele așteptate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
set.seed(42)
# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)
# Extract the training data frame
training_data <- ___
# Extract the testing data frame
testing_data <- ___
# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)