Încearcă o împărțire 60/40
Așa cum ai văzut în videoclip, vei lucra cu setul de date Sonar în acest capitol, folosind 60% pentru antrenament și 40% pentru testare. Hai să mai exersăm o dată împărțirea în set de antrenament și set de testare, ca să te asiguri că ai înțeles bine procedeul. Reamintește-ți că poți folosi funcția sample() pentru a obține o permutare aleatoare a indicilor rândurilor dintr-un set de date, pe care să o folosești la împărțire, de exemplu:
n_obs <- nrow(my_data)
permuted_rows <- sample(n_obs)
Apoi folosești acești indici pentru a reordona aleator setul de date, de exemplu:
my_data <- my_data[permuted_rows, ]
Odată ce setul de date este ordonat aleator, poți extrage primele 60% ca set de antrenament și ultimele 40% ca set de testare.
Acest exercițiu face parte din cursul
Machine Learning cu caret în R
Instrucțiuni pentru exercițiu
- Obține numărul de observații (rânduri) din
Sonarși atribuie-l variabilein_obs. - Amestecă indicii rândurilor din
Sonarși stochează rezultatul înpermuted_rows. - Folosește
permuted_rowspentru a reordona aleator rândurile dinSonar, salvând rezultatul caSonar_shuffled. - Identifică rândul corect la care să faci împărțirea pentru un split 60/40. Stochează acest număr de rând în variabila
split. - Salvează primele 60% din
Sonar_shuffledca set de antrenament. - Salvează ultimele 40% din
Sonar_shuffledca set de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Get the number of observations
# Shuffle row indices: permuted_rows
# Randomly order data: Sonar
# Identify row to split on: split
split <- round(n_obs * ___)
# Create train
# Create test