Создание случайных тестовых наборов данных
Прежде чем строить более сложную модель кредитования, важно отложить часть данных о займах — чтобы проверить, насколько хорошо модель будет предсказывать результаты для будущих заявителей.
Как показано на изображении ниже, вы можете использовать 75% наблюдений для обучения и 25% — для тестирования модели.

Функция sample() позволяет сформировать случайную выборку строк для включения в обучающую выборку. Просто передайте ей общее количество наблюдений и количество строк, необходимых для обучения.
Полученный вектор идентификаторов строк используйте для разбиения набора данных loans на обучающую и тестовую выборки. Набор данных loans уже доступен для работы.
Это упражнение является частью курса
Обучение с учителем в R: классификация
Инструкции к упражнению
- Примените функцию
nrow(), чтобы определить количество наблюдений в наборе данныхloansи вычислить, сколько строк составляют 75% выборки. - Используйте функцию
sample(), чтобы создать целочисленный вектор идентификаторов строк для 75%-й выборки. Первый аргументsample()— это общее количество строк в наборе данных, второй — количество строк для обучающей выборки. - Отберите строки из
loansпо идентификаторам, чтобы создать обучающую выборку. Сохраните результат в переменнуюloans_train. - Снова отберите строки из
loans, но на этот раз выберите все строки, которые не входят вsample_rows. Сохраните результат в переменнуюloans_test.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]