Ordonează aleatoriu setul de date
O modalitate de a împărți un set de date în seturi de antrenament și de testare este să îl ordonezi aleatoriu, apoi să îl divizi în cele două seturi. Astfel, atât setul de antrenament, cât și cel de testare vor fi eșantioane aleatorii, eliminând eventualele distorsiuni din ordonarea inițială a datelor (de exemplu, dacă acestea fuseseră ordonate după preț sau dimensiune). Poți să-ți imaginezi că amesteci un pachet nou de cărți de joc înainte de a le împărți.
În primul rând, setezi o sămânță aleatorie pentru a asigura reproductibilitatea și a obține aceeași împărțire de fiecare dată când rulezi scriptul:
set.seed(42)
Apoi, folosești funcția sample() pentru a amesteca indicii rândurilor din setul de date diamonds. Vei putea utiliza ulterior acești indici pentru a reordona setul de date.
rows <- sample(nrow(diamonds))
În final, poți folosi acest vector aleatoriu pentru a reordona setul de date diamonds:
diamonds <- diamonds[rows, ]
Acest exercițiu face parte din cursul
Machine Learning cu caret în R
Instrucțiuni pentru exercițiu
- Setează sămânța aleatorie la 42.
- Creează un vector de indici ai rândurilor numit
rows. - Reordonează aleatoriu setul de date
diamondsși atribuie rezultatul variabileishuffled_diamonds.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Set seed
# Shuffle row indices: rows
# Randomly order data