ПочатиПочніть безкоштовно

Створення випадкових тестових наборів даних

Перш ніж будувати складнішу модель кредитування, важливо відкласти частину даних про позики, щоб змоделювати, наскільки добре вона передбачатиме результати для майбутніх заявників.

Як показано на зображенні нижче, ви можете використати 75% спостережень для тренування та 25% — для тестування моделі.

Функцію sample() можна використати, щоб згенерувати випадкову вибірку рядків для включення до тренувального набору. Просто передайте їй загальну кількість спостережень і кількість, потрібну для тренування.

Скористайтеся отриманим вектором ідентифікаторів рядків, щоб розбити дані про позики на тренувальний і тестовий набори. Набір даних loans доступний для використання.

Ця вправа є частиною курсу

Наглядове навчання в R: Класифікація

Переглянути курс

Інструкції до вправи

  • Застосуйте функцію nrow(), щоб визначити, скільки спостережень у наборі loans, і скільки потрібно для 75% вибірки.
  • Використайте функцію sample(), щоб створити цілочисельний вектор ідентифікаторів рядків для 75% вибірки. Першим аргументом sample() має бути кількість рядків у наборі даних, другим — кількість рядків, потрібна у вашому тренувальному наборі.
  • Зробіть підвибірку даних loans за цими ідентифікаторами рядків, щоб створити тренувальний набір. Збережіть його як loans_train.
  • Знову зробіть підвибірку loans, але цього разу виберіть усі рядки, яких немає в sample_rows. Збережіть це як loans_test

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Determine the number of rows for training


# Create a random sample of row IDs
sample_rows <- sample(___, ___)

# Create the training dataset
loans_train <- loans[___]

# Create the test dataset
loans_test <- loans[___]
Редагувати та запускати код