कॉलम महत्व और डिफॉल्ट प्रेडिक्शन
जब आप कई अलग-अलग कॉलम समूहों वाले अनेक प्रशिक्षण सेट्स के साथ काम करते हैं, तो यह देखना महत्वपूर्ण है कि किन कॉलम्स का महत्व है और किनका नहीं. कुछ कॉलम्स का रखरखाव महंगा या समय लेने वाला हो सकता है, जबकि उनका loan_status पर कोई प्रभाव नहीं पड़ता.
इस अभ्यास के लिए X डेटा निम्न कोड से बनाया गया था:
X = cr_loan_prep[['person_income','loan_int_rate',
'loan_percent_income','loan_amnt',
'person_home_ownership_MORTGAGE','loan_grade_F']]
इस डेटा पर एक XGBClassifier() मॉडल ट्रेन कीजिए, और कॉलम इम्पोर्टेंस जाँचिए ताकि पता चले कि loan_status की भविष्यवाणी में प्रत्येक कॉलम कैसा प्रदर्शन करता है.
cr_loan_pret डेटासेट के साथ X_train और y_train वर्कस्पेस में लोड किए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में क्रेडिट रिस्क मॉडलिंग
अभ्यास निर्देश
X_trainऔरy_trainप्रशिक्षण सेट्स परXGBClassifier()मॉडल बनाएँ और ट्रेन करें, और उसेclf_gbtके रूप में स्टोर करें..get_booster()और.get_score()का उपयोग करकेclf_gbtमें कॉलम्स की इम्पोर्टेंस प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create and train the model on the training data
____ = xgb.____().____(____,np.ravel(____))
# Print the column importances from the model
print(clf_gbt.____().____(importance_type = 'weight'))