डिफॉल्ट की probability का अनुमान लगाना
सारा डेटा प्रोसेसिंग पूरा हो चुका है और अब डिफॉल्ट की probability के लिए प्रेडिक्शन बनाना शुरू करने का समय है। आप डेटा पर एक LogisticRegression() मॉडल ट्रेन करना चाहते हैं और देखना चाहते हैं कि यह डिफॉल्ट की probability कैसे प्रेडिक्ट करता है।
ताकि आप predict_proba से मॉडल क्या देता है, इसे बेहतर तरीके से समझ सकें, आपको एक उदाहरण रिकॉर्ड को डिफॉल्ट की प्रेडिक्टेड probability के साथ देखना चाहिए। पहली पाँच प्रेडिक्शंस loan_status के वास्तविक मानों के मुकाबले कैसी दिखती हैं?
डेटासेट cr_loan_prep के साथ X_train, X_test, y_train, और y_test पहले से ही वर्कस्पेस में लोड हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में क्रेडिट रिस्क मॉडलिंग
अभ्यास निर्देश
- ट्रेनिंग डेटा पर एक logistic regression मॉडल ट्रेन करें और उसे
clf_logisticके रूप में स्टोर करें. - टेस्ट डेटा पर
predict_proba()का उपयोग करके प्रेडिक्शंस बनाएँ और उन्हेंpredsमें स्टोर करें. - दो data frames,
preds_dfऔरtrue_df, बनाएँ ताकि पहली पाँच प्रेडिक्शंस और trueloan_statusमान स्टोर किए जा सकें. .concat()का उपयोग करकेtrue_dfऔरpreds_dfको एक साथ प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))