डिफॉल्ट के लिए Trees
अब आप क्रेडिट डेटा पर एक gradient boosted tree मॉडल ट्रेन करेंगे और कुछ प्रेडिक्शन का सैंपल देखेंगे. क्या आपको याद है जब आपने logistic regression मॉडल के प्रेडिक्शन पहली बार देखे थे? वे अच्छे नहीं लगे थे. क्या आपको लगता है यह मॉडल अलग साबित होगा?
वर्कस्पेस में क्रेडिट डेटा cr_loan_prep, training सेट्स X_train और y_train, और टेस्ट डेटा X_test उपलब्ध है. XGBoost पैकेज xgb नाम से लोड है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में क्रेडिट रिस्क मॉडलिंग
अभ्यास निर्देश
XGBClassifier()का उपयोग करके एक gradient boosted tree बनाएँ और उसेclf_gbtनाम दें, फिर उसे ट्रेन करें.- टेस्ट डेटा पर default की probabilities प्रेडिक्ट करें और नतीजे
gbt_predsमें रखें. - दो data frames बनाएँ,
preds_dfऔरtrue_df, जिनमें पहली पाँच प्रेडिक्शन और वास्तविकloan_statusमान रखें. - दिए गए क्रम में
true_dfऔरpreds_dfको concatenate करके प्रिंट करें, और मॉडल के नतीजे जाँचें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Train a model
import xgboost as xgb
____ = xgb.____().fit(____, np.ravel(____))
# Predict with a model
____ = clf_gbt.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([____.reset_index(drop = True), ____], axis = 1))