Förbehandling i en pipeline
Nu när du har sett vilka steg som krävs för att bearbeta Ames-husdata på rätt sätt, är det dags att använda det smidigare DictVectorizer-upplägget och kombinera det med en XGBoostRegressor i en scikit-learn-pipeline.
Den här övningen är en del av kursen
Extreme Gradient Boosting med XGBoost
Övningsinstruktioner
- Importera
DictVectorizerfrånsklearn.feature_extractionochPipelinefrånsklearn.pipeline. - Fyll i saknade värden i kolumnen
LotFrontageiXmed0. - Slutför stegen i pipelinen med
DictVectorizer(sparse=False)för"ohe_onestep"ochxgb.XGBRegressor()för"xgb_model". - Skapa pipelinen med
Pipeline()ochsteps. - Träna pipelinen. Glöm inte att konvertera
Xtill ett format somDictVectorizerförstår genom att anropa metodento_dict("records")påX.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import necessary modules
____
____
# Fill LotFrontage missing values with 0
X.LotFrontage = ____
# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
("xgb_model", ____)]
# Create the pipeline: xgb_pipeline
xgb_pipeline = ____
# Fit the pipeline
____