ÎncepețiÎncepe gratuit

Împărțirea în seturi de antrenament și testare

Într-un flux de lucru disciplinat de învățare automată, este esențial să reții o parte din date (datele de testare) în afara oricărui proces de decizie. Astfel, poți evalua independent performanța modelului tău după ce acesta este finalizat. Restul datelor, datele de antrenament, sunt folosite pentru a construi și a selecta cel mai bun model.

În acest exercițiu, vei folosi pachetul rsample pentru a împărți datele și a realiza separarea inițială în set de antrenament și set de testare pentru datele tale gapminder.

Notă: Deoarece această împărțire este aleatorie, este recomandat să setezi un seed înainte de a o realiza.

Acest exercițiu face parte din cursul

Machine Learning în Tidyverse

Vezi cursul

Instrucțiuni pentru exercițiu

  • Împarte datele în 75% antrenament și 25% testare folosind funcția initial_split() și atribuie rezultatul variabilei gap_split.
  • Extrage setul de date de antrenament din gap_split folosind funcția training().
  • Extrage setul de date de testare din gap_split folosind funcția testing().
  • Verifică dimensiunile noilor seturi de date folosind funcția dim() pe training_data și testing_data, pentru a te asigura că sunt cele așteptate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

set.seed(42)

# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)

# Extract the training data frame
training_data <- ___

# Extract the testing data frame
testing_data <- ___

# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)
Editează și rulează codul