Vytváření náhodných testovacích datasetů
Než vytvoříš sofistikovanější model pro půjčky, je důležité vyčlenit část dat, abys mohl/a simulovat, jak dobře bude model předpovídat výsledky budoucích žadatelů o půjčku.
Jak ukazuje následující obrázek, na trénování modelu můžeš použít 75 % pozorování a zbývajících 25 % si nechat na testování.

Funkce sample() umožňuje vygenerovat náhodný výběr řádků, které budou součástí trénovací sady. Stačí zadat celkový počet pozorování a počet, kolik jich potřebuješ pro trénování.
Výsledný vektor ID řádků pak použij k rozdělení datasetu loans na trénovací a testovací část. Dataset loans máš k dispozici.
Toto cvičení je součástí kurzu
Supervised Learning v R: Klasifikace
Pokyny k cvičení
- Pomocí funkce
nrow()zjisti, kolik pozorování datasetloansobsahuje, a vypočítej počet řádků potřebných pro 75% vzorek. - Pomocí funkce
sample()vytvoř celočíselný vektor ID řádků pro 75% vzorek. Prvním argumentemsample()je celkový počet řádků v datasetu, druhým je počet řádků, které potřebuješ v trénovací sadě. - Pomocí ID řádků vytvoř z dat
loanstrénovací dataset a ulož ho jakoloans_train. - Znovu vyfiltruj data
loans, tentokrát ale vyber všechny řádky, které nejsou vsample_rows. Výsledek ulož jakoloans_test.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]