Построение и оценка более сложного дерева
Ранее вы построили простое дерево решений, которое использовало кредитный рейтинг заявителя и запрашиваемую сумму займа для прогнозирования результата рассмотрения заявки.
Lending Club располагает дополнительными сведениями о заявителях: статус владения жильём, стаж работы, цель займа и наличие прошлых банкротств. Эти данные могут помочь строить более точные прогнозы.
Используя все доступные данные о заявителях, постройте более сложную модель кредитования на основе обучающей выборки, созданной ранее. Затем примените эту модель к тестовой выборке, чтобы оценить её эффективность на новых кредитных заявках.
Пакет rpart уже подключён, а наборы данных loans_train и loans_test созданы.
Это упражнение является частью курса
Обучение с учителем в R: классификация
Инструкции к упражнению
- С помощью
rpart()постройте модель кредитования на обучающей выборке, используя все доступные предикторы. Аргументcontrolоставьте без изменений. - Примените функцию
predict()к тестовой выборке и сохраните результат в виде вектора прогнозируемых исходов. Не забудьте указать аргументtype. - Создайте таблицу с помощью
table(), чтобы сравнить предсказанные значения с фактическими значениямиoutcome. - Вычислите точность прогнозов с помощью функции
mean().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Grow a tree using all of the available applicant data
loan_model <- rpart(___, data = ___, method = "___", control = rpart.control(cp = 0))
# Make predictions on the test dataset
loans_test$pred <- ___
# Examine the confusion matrix
table(___, ___)
# Compute the accuracy on the test dataset
mean(___)