Preprocesare într-un pipeline
Acum că ai văzut care sunt pașii necesari pentru a procesa corect datele despre locuințe din Ames, hai să folosim abordarea mai curată și mai concisă cu DictVectorizer și să o integrăm alături de un XGBoostRegressor într-un pipeline scikit-learn.
Acest exercițiu face parte din cursul
Gradient Boosting Extrem cu XGBoost
Instrucțiuni pentru exercițiu
- Importă
DictVectorizerdinsklearn.feature_extractionșiPipelinedinsklearn.pipeline. - Completează valorile lipsă din coloana
LotFrontagea luiXcu0. - Completează pașii pipeline-ului cu
DictVectorizer(sparse=False)pentru"ohe_onestep"șixgb.XGBRegressor()pentru"xgb_model". - Creează pipeline-ul folosind
Pipeline()șisteps. - Antrenează pipeline-ul. Nu uita să convertești
Xîntr-un format pe careDictVectorizerîl înțelege, apelând metodato_dict("records")peX.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import necessary modules
____
____
# Fill LotFrontage missing values with 0
X.LotFrontage = ____
# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
("xgb_model", ____)]
# Create the pipeline: xgb_pipeline
xgb_pipeline = ____
# Fit the pipeline
____