ÎncepețiÎncepe gratuit

Împărțirea setului de date

Pentru a crea seturile de antrenament și de testare, trebuie mai întâi să setezi o sămânță (seed) folosind set.seed(). Seed-urile îți permit să definești un punct de pornire pentru generarea aleatoare a numerelor, astfel încât de fiecare dată când rulezi codul să obții același rezultat. Avantajul este că tu sau oricine altcineva poate recrea exact aceleași seturi de antrenament și de testare utilizând același seed.

Cu ajutorul funcției sample(), poți atribui aleatoriu observații setului de antrenament și celui de testare.

În acest exercițiu vei folosi primele două argumente ale funcției sample():

  • Primul argument este vectorul din care vor fi eșantionate valorile. Vom selecta aleatoriu numere de rând ca indici; poți folosi 1:nrow(loan_data) pentru a crea vectorul numerelor de rând.
  • Al doilea argument reprezintă numărul de elemente de selectat. Vom introduce 2 / 3 * nrow(loan_data), deoarece construim mai întâi setul de antrenament.

Acest exercițiu face parte din cursul

Modelarea riscului de credit în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Setează un seed de 567 folosind funcția set.seed().
  • Stochează indicii de rând ai setului de antrenament în obiectul index_train. Folosește funcția sample() cu primul și al doilea argument, așa cum s-a discutat mai sus.
  • Creează setul de antrenament selectând numerele de rând stocate în index_train din setul de date loan_data. Salvează rezultatul în training_set.
  • Setul de testare conține rândurile care nu se află în index_train. Copiază codul folosit pentru a crea setul de antrenament, dar adaugă semnul minus (-) imediat înaintea lui index_train din interiorul parantezelor pătrate. Salvează rezultatul în test_set.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Set seed of 567


# Store row numbers for training set: index_train


# Create training set: training_set
training_set <- loan_data[___, ]

# Create test set: test_set
Editează și rulează codul