Împărțirea setului de date
Pentru a crea seturile de antrenament și de testare, trebuie mai întâi să setezi o sămânță (seed) folosind set.seed(). Seed-urile îți permit să definești un punct de pornire pentru generarea aleatoare a numerelor, astfel încât de fiecare dată când rulezi codul să obții același rezultat. Avantajul este că tu sau oricine altcineva poate recrea exact aceleași seturi de antrenament și de testare utilizând același seed.
Cu ajutorul funcției sample(), poți atribui aleatoriu observații setului de antrenament și celui de testare.
În acest exercițiu vei folosi primele două argumente ale funcției sample():
- Primul argument este vectorul din care vor fi eșantionate valorile. Vom selecta aleatoriu numere de rând ca indici; poți folosi
1:nrow(loan_data)pentru a crea vectorul numerelor de rând. - Al doilea argument reprezintă numărul de elemente de selectat. Vom introduce
2 / 3 * nrow(loan_data), deoarece construim mai întâi setul de antrenament.
Acest exercițiu face parte din cursul
Modelarea riscului de credit în R
Instrucțiuni pentru exercițiu
- Setează un seed de 567 folosind funcția
set.seed(). - Stochează indicii de rând ai setului de antrenament în obiectul
index_train. Folosește funcțiasample()cu primul și al doilea argument, așa cum s-a discutat mai sus. - Creează setul de antrenament selectând numerele de rând stocate în
index_traindin setul de dateloan_data. Salvează rezultatul întraining_set. - Setul de testare conține rândurile care nu se află în
index_train. Copiază codul folosit pentru a crea setul de antrenament, dar adaugă semnul minus (-) imediat înaintea luiindex_traindin interiorul parantezelor pătrate. Salvează rezultatul întest_set.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Set seed of 567
# Store row numbers for training set: index_train
# Create training set: training_set
training_set <- loan_data[___, ]
# Create test set: test_set