सब कुछ एक साथ लाएँ
ठीक है, अब तक आपने जो कुछ सीखा है उसे एक साथ लाने का समय है! कोर्स के इस अंतिम अभ्यास में, आप पिछले अभ्यासों के अपने काम को मिलाकर एक एंड-टू-एंड XGBoost पाइपलाइन बनाएँगे, ताकि XGBoost में प्रीप्रोसेसिंग और पाइपलाइन्स की आपकी समझ पक्की हो जाए.
पिछले 3 अभ्यासों में जहाँ आपने डेटा को प्रीप्रोसेस किया और अपनी पाइपलाइन सेट अप की थी, वह सब प्रीलोड किया गया है. आपका काम है एक randomized search चलाना और सर्वश्रेष्ठ हाइपरपैरामीटर्स पहचानना.
यह अभ्यास पाठ्यक्रम का हिस्सा है
XGBoost के साथ Extreme Gradient Boosting
अभ्यास निर्देश
- पैरामीटर ग्रिड सेट करें ताकि
'clf__learning_rate'(0.05से1तक0.05के स्टेप्स में),'clf__max_depth'(3से10तक1के स्टेप्स में), और'clf__n_estimators'(50से200तक50के स्टेप्स में) ट्यून किए जा सकें. - अपने
pipelineको estimator के रूप में उपयोग करते हुए,n_iter2के साथ 2-foldRandomizedSearchCVकरें. मेट्रिक के रूप में"roc_auc"उपयोग करें, और आउटपुट अधिक विस्तृत पाने के लिएverboseको1पर सेट करें. परिणाम कोrandomized_roc_aucमें स्टोर करें. randomized_roc_aucकोXऔरyपर फिट करें.randomized_roc_aucका best score और best estimator compute करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create the parameter grid
gbm_param_grid = {
'____': ____(____, ____, ____),
'____': ____(____, ____, ____),
'____': ____(____, ____, ____)
}
# Perform RandomizedSearchCV
randomized_roc_auc = ____
# Fit the estimator
____
# Compute metrics
print(____)
print(____)