Создание обучающей и тестовой выборок
Вы уже обучили модели LogisticRegression() на различных столбцах.
Данные необходимо разделить на обучающую и тестовую выборки. Функция test_train_split() позволяет создать обе сразу. Обучающая выборка используется для построения предсказаний, а тестовая — для оценки качества модели. Без такой оценки невозможно понять, насколько хорошо модель будет работать на новых кредитных данных.
Помимо атрибута intercept_, модели LogisticRegression() также имеют атрибут .coef_. Он показывает, насколько важен каждый обучающий столбец для предсказания вероятности дефолта.
Набор данных cr_loan_clean уже загружен в рабочей области.
Это упражнение является частью курса
Моделирование кредитного риска на Python
Инструкции к упражнению
- Создайте набор данных
X, используя процентную ставку, стаж работы и доход. Создайте наборy, используя статус кредита. - Используйте
train_test_split(), чтобы создать обучающую и тестовую выборки изXиy. - Создайте и обучите модель
LogisticRegression(), сохранив её в переменнуюclf_logistic. - Выведите коэффициенты модели с помощью
.coef_.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]
# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)
# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Print the models coefficients
print(____.coef_)