НачатьНачать бесплатно

Создание случайных тестовых наборов данных

Прежде чем строить более сложную модель кредитования, важно отложить часть данных о займах — чтобы проверить, насколько хорошо модель будет предсказывать результаты для будущих заявителей.

Как показано на изображении ниже, вы можете использовать 75% наблюдений для обучения и 25% — для тестирования модели.

Функция sample() позволяет сформировать случайную выборку строк для включения в обучающую выборку. Просто передайте ей общее количество наблюдений и количество строк, необходимых для обучения.

Полученный вектор идентификаторов строк используйте для разбиения набора данных loans на обучающую и тестовую выборки. Набор данных loans уже доступен для работы.

Это упражнение является частью курса

Обучение с учителем в R: классификация

Посмотреть курс

Инструкции к упражнению

  • Примените функцию nrow(), чтобы определить количество наблюдений в наборе данных loans и вычислить, сколько строк составляют 75% выборки.
  • Используйте функцию sample(), чтобы создать целочисленный вектор идентификаторов строк для 75%-й выборки. Первый аргумент sample() — это общее количество строк в наборе данных, второй — количество строк для обучающей выборки.
  • Отберите строки из loans по идентификаторам, чтобы создать обучающую выборку. Сохраните результат в переменную loans_train.
  • Снова отберите строки из loans, но на этот раз выберите все строки, которые не входят в sample_rows. Сохраните результат в переменную loans_test.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Determine the number of rows for training


# Create a random sample of row IDs
sample_rows <- sample(___, ___)

# Create the training dataset
loans_train <- loans[___]

# Create the test dataset
loans_test <- loans[___]
Редактировать и запускать код