Předzpracování dat v rámci pipeline
Teď, když víš, jaké kroky je potřeba provést pro správné zpracování dat o bydlení z Ames, využijeme přehlednější přístup s DictVectorizer a zařadíme ho spolu s XGBoostRegressor do scikit-learn pipeline.
Toto cvičení je součástí kurzu
Extreme Gradient Boosting with XGBoost
Pokyny k cvičení
- Importuj
DictVectorizerzsklearn.feature_extractionaPipelinezsklearn.pipeline. - Doplň chybějící hodnoty ve sloupci
LotFrontagevXhodnotou0. - Dokonči kroky pipeline: pro
"ohe_onestep"použijDictVectorizer(sparse=False)a pro"xgb_model"použijxgb.XGBRegressor(). - Vytvoř pipeline pomocí
Pipeline()asteps. - Natrénuj pipeline. Nezapomeň převést
Xdo formátu, kterémuDictVectorizerrozumí – zavolej naXmetoduto_dict("records").
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import necessary modules
____
____
# Fill LotFrontage missing values with 0
X.LotFrontage = ____
# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
("xgb_model", ____)]
# Create the pipeline: xgb_pipeline
xgb_pipeline = ____
# Fit the pipeline
____