Prétraitement dans un pipeline
Maintenant que vous avez vu les étapes à effectuer séparément pour bien traiter les données sur le logement à Ames, utilisons l'approche beaucoup plus propre et concise avec DictVectorizer et plaçons-la aux côtés d'un XGBoostRegressor dans un pipeline scikit-learn.
Cette activité fait partie du cours
Amorçage de gradient avancé avec XGBoost
Instructions de l’exercice
- Importez
DictVectorizerdepuissklearn.feature_extractionetPipelinedepuissklearn.pipeline. - Remplissez les valeurs manquantes dans la colonne
LotFrontagedeXavec0. - Complétez les étapes du pipeline avec
DictVectorizer(sparse=False)pour"ohe_onestep"etxgb.XGBRegressor()pour"xgb_model". - Créez le pipeline à l'aide de
Pipeline()et desteps. - Ajustez le
Pipeline. N'oubliez pas de convertirXdans un format queDictVectorizercomprend en appelant la méthodeto_dict("records")surX.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import necessary modules
____
____
# Fill LotFrontage missing values with 0
X.LotFrontage = ____
# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
("xgb_model", ____)]
# Create the pipeline: xgb_pipeline
xgb_pipeline = ____
# Fit the pipeline
____