Створення випадкових тестових наборів даних
Перш ніж будувати складнішу модель кредитування, важливо відкласти частину даних про позики, щоб змоделювати, наскільки добре вона передбачатиме результати для майбутніх заявників.
Як показано на зображенні нижче, ви можете використати 75% спостережень для тренування та 25% — для тестування моделі.

Функцію sample() можна використати, щоб згенерувати випадкову вибірку рядків для включення до тренувального набору. Просто передайте їй загальну кількість спостережень і кількість, потрібну для тренування.
Скористайтеся отриманим вектором ідентифікаторів рядків, щоб розбити дані про позики на тренувальний і тестовий набори. Набір даних loans доступний для використання.
Ця вправа є частиною курсу
Наглядове навчання в R: Класифікація
Інструкції до вправи
- Застосуйте функцію
nrow(), щоб визначити, скільки спостережень у наборіloans, і скільки потрібно для 75% вибірки. - Використайте функцію
sample(), щоб створити цілочисельний вектор ідентифікаторів рядків для 75% вибірки. Першим аргументомsample()має бути кількість рядків у наборі даних, другим — кількість рядків, потрібна у вашому тренувальному наборі. - Зробіть підвибірку даних
loansза цими ідентифікаторами рядків, щоб створити тренувальний набір. Збережіть його якloans_train. - Знову зробіть підвибірку
loans, але цього разу виберіть усі рядки, яких немає вsample_rows. Збережіть це якloans_test
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]