Попередня обробка в конвеєрі
Тепер, коли ви побачили, які кроки потрібно виконати окремо, щоб коректно обробити дані про житло в Еймсі, скористаймося значно чистішим і стисленим підходом із DictVectorizer та поєднаймо його з XGBoostRegressor у конвеєрі scikit-learn.
Ця вправа є частиною курсу
Екстремальний градієнтний бустинг з XGBoost
Інструкції до вправи
- Імпортуйте
DictVectorizerізsklearn.feature_extractionіPipelineізsklearn.pipeline. - Заповніть пропущені значення в стовпці
LotFrontageдатафреймуXзначенням0. - Завершіть кроки конвеєра, використавши
DictVectorizer(sparse=False)для"ohe_onestep"іxgb.XGBRegressor()для"xgb_model". - Створіть конвеєр за допомогою
Pipeline()іsteps. - Навчіть
Pipeline. Не забудьте перетворитиXу формат, який розумієDictVectorizer, викликавши методto_dict("records")дляX.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import necessary modules
____
____
# Fill LotFrontage missing values with 0
X.LotFrontage = ____
# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
("xgb_model", ____)]
# Create the pipeline: xgb_pipeline
xgb_pipeline = ____
# Fit the pipeline
____