Crearea seturilor de date de testare aleatoare
Înainte de a construi un model de creditare mai sofisticat, este important să rezervi o parte din datele despre împrumuturi pentru a simula cât de bine va prezice rezultatele viitoarelor cereri de credit.
Așa cum este ilustrat în imaginea de mai jos, poți folosi 75% din observații pentru antrenament și 25% pentru testarea modelului.

Funcția sample() poate fi folosită pentru a genera un eșantion aleator de rânduri care vor fi incluse în setul de antrenament. Furnizează-i numărul total de observații și numărul necesar pentru antrenament.
Folosește vectorul rezultat de ID-uri de rânduri pentru a împărți datele loans în seturi de antrenament și de testare. Setul de date loans este disponibil pentru utilizare.
Acest exercițiu face parte din cursul
Supervised Learning în R: Clasificare
Instrucțiuni pentru exercițiu
- Aplică funcția
nrow()pentru a determina câte observații conține setul de dateloansși câte sunt necesare pentru un eșantion de 75%. - Folosește funcția
sample()pentru a crea un vector de întregi cu ID-urile rândurilor pentru eșantionul de 75%. Primul argument al funcțieisample()trebuie să fie numărul total de rânduri din set, iar al doilea – numărul de rânduri necesar în setul de antrenament. - Filtrează datele
loansfolosind ID-urile de rânduri pentru a crea setul de antrenament. Salvează rezultatul caloans_train. - Filtrează din nou
loans, dar de această dată selectează toate rândurile care nu se află însample_rows. Salvează rezultatul caloans_test.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]