डिफॉल्ट क्लासिफिकेशन रिपोर्टिंग
अब मॉडल के मूल्यांकन को और करीब से देखने का समय है. यहीं पर probability of default के लिए थ्रेशोल्ड सेट करना क्लासिफिकेशन रिपोर्टिंग के ज़रिए मॉडल के प्रदर्शन का विश्लेषण करने में आपकी मदद करेगा.
प्रॉबैबिलिटीज़ का एक डेटा फ़्रेम बनाने से उनके साथ काम करना आसान हो जाता है, क्योंकि आप pandas की पूरी क्षमता का उपयोग कर सकते हैं. डेटा पर थ्रेशोल्ड लागू करें और loan_status की दोनों क्लासों के लिए वैल्यू काउंट्स देखें ताकि समझ सकें कि प्रत्येक के कितने प्रेडिक्शन बन रहे हैं. यह क्लासिफिकेशन रिपोर्ट के स्कोर को समझने में मदद करेगा.
वर्कस्पेस में cr_loan_prep डेटा सेट, प्रशिक्षित logistic regression clf_logistic, वास्तविक loan status मान y_test, और प्रेडिक्टेड प्रॉबैबिलिटीज़ preds लोड हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में क्रेडिट रिस्क मॉडलिंग
अभ्यास निर्देश
predsसे सिर्फ probability of default का डेटा फ़्रेम बनाएँ और उसेpreds_dfनाम दें.preds_dfमें probability of default के लिए0.50के थ्रेशोल्ड के आधार परloan_statusमानों को फिर से असाइन करें.- प्रत्येक
loan_statusके लिए पंक्तियों की संख्या के वैल्यू काउंट्स प्रिंट करें. y_testऔरpreds_dfका उपयोग करके क्लासिफिकेशन रिपोर्ट प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create a dataframe for the probabilities of default
____ = pd.____(____[:,1], columns = ['prob_default'])
# Reassign loan status based on the threshold
____[____] = ____[____].apply(lambda x: 1 if x > ____ else 0)
# Print the row counts for each loan status
print(____[____].____())
# Print the classification report
target_names = ['Non-Default', 'Default']
print(____(____, ____['loan_status'], target_names=target_names))