Dự đoán xác suất vỡ nợ
Toàn bộ bước xử lý dữ liệu đã hoàn tất và đây là lúc bắt đầu tạo dự đoán xác suất vỡ nợ. Bạn muốn huấn luyện một mô hình LogisticRegression() trên dữ liệu và xem nó dự đoán xác suất vỡ nợ như thế nào.
Để bạn hiểu rõ hơn mô hình tạo ra gì với predict_proba, bạn nên xem một bản ghi ví dụ cùng với xác suất vỡ nợ được dự đoán. Năm dự đoán đầu tiên so với giá trị thực của loan_status trông ra sao?
Bộ dữ liệu cr_loan_prep cùng với X_train, X_test, y_train và y_test đã được nạp sẵn trong không gian làm việc.
Bài tập này là một phần của khóa học
Mô hình hóa Rủi ro Tín dụng bằng Python
Hướng dẫn bài tập
- Huấn luyện một mô hình logistic regression trên dữ liệu huấn luyện và lưu là
clf_logistic. - Dùng
predict_proba()trên dữ liệu kiểm tra để tạo dự đoán và lưu vàopreds. - Tạo hai data frame,
preds_dfvàtrue_df, để lưu 5 dự đoán đầu tiên và các giá trịloan_statusthực tế tương ứng. - In
true_dfvàpreds_dfcùng nhau bằng.concat().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))