पाइपलाइन के भीतर प्रीप्रोसेसिंग
अब जबकि आपने देख लिया है कि Ames हाउसिंग डेटा को सही तरीके से प्रोसेस करने के लिए कौन-से कदम अलग-अलग लेने पड़ते हैं, आइए अब और साफ़-सुथरे और संक्षिप्त DictVectorizer तरीके का उपयोग करें और इसे scikit-learn पाइपलाइन के अंदर XGBoostRegressor के साथ रखें.
यह अभ्यास पाठ्यक्रम का हिस्सा है
XGBoost के साथ Extreme Gradient Boosting
अभ्यास निर्देश
sklearn.feature_extractionसेDictVectorizerऔरsklearn.pipelineसेPipelineइम्पोर्ट करें.XकीLotFrontageकॉलम में किसी भी missing वैल्यू को0से भरें.- पाइपलाइन के स्टेप्स को पूरा करें:
"ohe_onestep"के लिएDictVectorizer(sparse=False)और"xgb_model"के लिएxgb.XGBRegressor()लगाएँ. Pipeline()औरstepsका उपयोग करके पाइपलाइन बनाएँ.Pipelineको fit करें. ध्यान रखें,DictVectorizerको समझ में आने वाले फ़ॉर्मेट में बदलने के लिएXपरto_dict("records")मेथड कॉल करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import necessary modules
____
____
# Fill LotFrontage missing values with 0
X.LotFrontage = ____
# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
("xgb_model", ____)]
# Create the pipeline: xgb_pipeline
xgb_pipeline = ____
# Fit the pipeline
____