ÎncepețiÎncepe gratuit

Crearea seturilor de date de testare aleatoare

Înainte de a construi un model de creditare mai sofisticat, este important să rezervi o parte din datele despre împrumuturi pentru a simula cât de bine va prezice rezultatele viitoarelor cereri de credit.

Așa cum este ilustrat în imaginea de mai jos, poți folosi 75% din observații pentru antrenament și 25% pentru testarea modelului.

Funcția sample() poate fi folosită pentru a genera un eșantion aleator de rânduri care vor fi incluse în setul de antrenament. Furnizează-i numărul total de observații și numărul necesar pentru antrenament.

Folosește vectorul rezultat de ID-uri de rânduri pentru a împărți datele loans în seturi de antrenament și de testare. Setul de date loans este disponibil pentru utilizare.

Acest exercițiu face parte din cursul

Supervised Learning în R: Clasificare

Vezi cursul

Instrucțiuni pentru exercițiu

  • Aplică funcția nrow() pentru a determina câte observații conține setul de date loans și câte sunt necesare pentru un eșantion de 75%.
  • Folosește funcția sample() pentru a crea un vector de întregi cu ID-urile rândurilor pentru eșantionul de 75%. Primul argument al funcției sample() trebuie să fie numărul total de rânduri din set, iar al doilea – numărul de rânduri necesar în setul de antrenament.
  • Filtrează datele loans folosind ID-urile de rânduri pentru a crea setul de antrenament. Salvează rezultatul ca loans_train.
  • Filtrează din nou loans, dar de această dată selectează toate rândurile care nu se află în sample_rows. Salvează rezultatul ca loans_test.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Determine the number of rows for training


# Create a random sample of row IDs
sample_rows <- sample(___, ___)

# Create the training dataset
loans_train <- loans[___]

# Create the test dataset
loans_test <- loans[___]
Editează și rulează codul