НачатьНачать бесплатно

Создание обучающей и тестовой выборок

Вы уже обучили модели LogisticRegression() на различных столбцах.

Данные необходимо разделить на обучающую и тестовую выборки. Функция test_train_split() позволяет создать обе сразу. Обучающая выборка используется для построения предсказаний, а тестовая — для оценки качества модели. Без такой оценки невозможно понять, насколько хорошо модель будет работать на новых кредитных данных.

Помимо атрибута intercept_, модели LogisticRegression() также имеют атрибут .coef_. Он показывает, насколько важен каждый обучающий столбец для предсказания вероятности дефолта.

Набор данных cr_loan_clean уже загружен в рабочей области.

Это упражнение является частью курса

Моделирование кредитного риска на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте набор данных X, используя процентную ставку, стаж работы и доход. Создайте набор y, используя статус кредита.
  • Используйте train_test_split(), чтобы создать обучающую и тестовую выборки из X и y.
  • Создайте и обучите модель LogisticRegression(), сохранив её в переменную clf_logistic.
  • Выведите коэффициенты модели с помощью .coef_.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]

# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)

# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))

# Print the models coefficients
print(____.coef_)
Редактировать и запускать код