НачатьНачать бесплатно

Предобработка данных в конвейере

Теперь, когда вы знаете, какие шаги необходимо выполнять по отдельности для правильной обработки данных об объектах недвижимости Эймса, воспользуемся более чистым и компактным подходом с DictVectorizer и разместим его вместе с XGBoostRegressor внутри конвейера scikit-learn.

Это упражнение является частью курса

Экстремальный градиентный бустинг с XGBoost

Посмотреть курс

Инструкции к упражнению

  • Импортируйте DictVectorizer из sklearn.feature_extraction и Pipeline из sklearn.pipeline.
  • Заполните пропущенные значения в столбце LotFrontage набора данных X значением 0.
  • Укажите шаги конвейера: DictVectorizer(sparse=False) для "ohe_onestep" и xgb.XGBRegressor() для "xgb_model".
  • Создайте конвейер с помощью Pipeline() и steps.
  • Обучите конвейер. Не забудьте привести X к формату, понятному DictVectorizer, вызвав метод to_dict("records") на объекте X.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import necessary modules
____
____

# Fill LotFrontage missing values with 0
X.LotFrontage = ____

# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
         ("xgb_model", ____)]

# Create the pipeline: xgb_pipeline
xgb_pipeline = ____

# Fit the pipeline
____
Редактировать и запускать код