ÎncepețiÎncepe gratuit

Crearea seturilor de antrenament și de testare

Împărțirea unui set de date în seturi de antrenament și de testare este un pas esențial în construirea și evaluarea unui model de clasificare. Setul de antrenament este folosit pentru a construi modelul, iar setul de testare pentru a-i evalua acuratețea predictivă.

În acest exercițiu, vei împărți setul de date creat în capitolul anterior în seturi de antrenament și de testare. Setul de date a fost încărcat în cadrul de date df, iar o valoare seed a fost deja setată pentru a asigura reproductibilitatea. Reamintește-ți că în videoclipul anterior am stabilit limita superioară pentru dimensiunea setului de antrenament folosind câteva funcții utile – acum e rândul tău să le aplici!

Acest exercițiu face parte din cursul

Support Vector Machines în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Determină limita superioară pentru numărul de rânduri din setul de antrenament și stocheaz-o în sample_size.
  • Creează vectorul train, care stochează rândurile alocate aleatoriu setului de antrenament conform proporției 80/20.
  • Atribuie rândurile din vectorul train cadrului de date trainset, iar restul cadrului de date testset.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))

# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)

# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]
Editează și rulează codul