НачатьНачать бесплатно

Прогнозирование вероятности дефолта

Все этапы обработки данных завершены — пора перейти к построению прогнозов вероятности дефолта. Вы обучите модель LogisticRegression() на подготовленных данных и посмотрите, как она предсказывает вероятность дефолта.

Чтобы лучше понять, что возвращает predict_proba, сравните несколько примеров из набора данных с предсказанными вероятностями. Как выглядят первые пять прогнозов по сравнению с реальными значениями loan_status?

Набор данных cr_loan_prep, а также X_train, X_test, y_train и y_test уже загружены в рабочую среду.

Это упражнение является частью курса

Моделирование кредитного риска на Python

Посмотреть курс

Инструкции к упражнению

  • Обучите модель логистической регрессии на обучающих данных и сохраните её в переменную clf_logistic.
  • Примените predict_proba() к тестовым данным и сохраните результат в переменную preds.
  • Создайте два датафрейма — preds_df и true_df — для хранения первых пяти прогнозов и соответствующих истинных значений loan_status.
  • Выведите true_df и preds_df как единый датафрейм с помощью .concat().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))

# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)

# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()

# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))
Редактировать и запускать код