Zacznij terazZacznij za darmo

Tworzenie losowych zbiorów testowych

Przed zbudowaniem bardziej zaawansowanego modelu kredytowego warto wydzielić część danych, aby sprawdzić, jak dobrze model będzie przewidywał wyniki przyszłych wnioskodawców.

Jak pokazano na poniższym obrazku, możesz wykorzystać 75% obserwacji do trenowania modelu i 25% do jego testowania.

Funkcja sample() umożliwia wygenerowanie losowej próby wierszy, które trafią do zbioru treningowego. Wystarczy podać jej łączną liczbę obserwacji oraz liczbę potrzebną do trenowania.

Użyj otrzymanego wektora identyfikatorów wierszy, aby podzielić zbiór loans na podzbiory treningowy i testowy. Zbiór danych loans jest już dostępny.

To ćwiczenie jest częścią kursu

Nadzorowane uczenie maszynowe w R: Klasyfikacja

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj funkcji nrow(), aby sprawdzić, ile obserwacji zawiera zbiór danych loans, i oblicz, ile z nich stanowi 75% próby.
  • Użyj funkcji sample(), aby utworzyć wektor liczb całkowitych z identyfikatorami wierszy dla 75% próby. Pierwszym argumentem funkcji sample() powinna być liczba wierszy w zbiorze danych, a drugim – liczba wierszy potrzebnych w zbiorze treningowym.
  • Przefiltruj dane loans za pomocą identyfikatorów wierszy, aby utworzyć zbiór treningowy. Zapisz go jako loans_train.
  • Ponownie przefiltruj loans, ale tym razem wybierz wszystkie wiersze, których nie ma w sample_rows. Zapisz wynik jako loans_test.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Determine the number of rows for training


# Create a random sample of row IDs
sample_rows <- sample(___, ___)

# Create the training dataset
loans_train <- loans[___]

# Create the test dataset
loans_test <- loans[___]
Edytuj i uruchom kod