Tworzenie losowych zbiorów testowych
Przed zbudowaniem bardziej zaawansowanego modelu kredytowego warto wydzielić część danych, aby sprawdzić, jak dobrze model będzie przewidywał wyniki przyszłych wnioskodawców.
Jak pokazano na poniższym obrazku, możesz wykorzystać 75% obserwacji do trenowania modelu i 25% do jego testowania.

Funkcja sample() umożliwia wygenerowanie losowej próby wierszy, które trafią do zbioru treningowego. Wystarczy podać jej łączną liczbę obserwacji oraz liczbę potrzebną do trenowania.
Użyj otrzymanego wektora identyfikatorów wierszy, aby podzielić zbiór loans na podzbiory treningowy i testowy. Zbiór danych loans jest już dostępny.
To ćwiczenie jest częścią kursu
Nadzorowane uczenie maszynowe w R: Klasyfikacja
Instrukcje do ćwiczenia
- Użyj funkcji
nrow(), aby sprawdzić, ile obserwacji zawiera zbiór danychloans, i oblicz, ile z nich stanowi 75% próby. - Użyj funkcji
sample(), aby utworzyć wektor liczb całkowitych z identyfikatorami wierszy dla 75% próby. Pierwszym argumentem funkcjisample()powinna być liczba wierszy w zbiorze danych, a drugim – liczba wierszy potrzebnych w zbiorze treningowym. - Przefiltruj dane
loansza pomocą identyfikatorów wierszy, aby utworzyć zbiór treningowy. Zapisz go jakoloans_train. - Ponownie przefiltruj
loans, ale tym razem wybierz wszystkie wiersze, których nie ma wsample_rows. Zapisz wynik jakoloans_test.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]