ÎncepețiÎncepe gratuit

Preprocesare într-un pipeline

Acum că ai văzut care sunt pașii necesari pentru a procesa corect datele despre locuințe din Ames, hai să folosim abordarea mai curată și mai concisă cu DictVectorizer și să o integrăm alături de un XGBoostRegressor într-un pipeline scikit-learn.

Acest exercițiu face parte din cursul

Gradient Boosting Extrem cu XGBoost

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă DictVectorizer din sklearn.feature_extraction și Pipeline din sklearn.pipeline.
  • Completează valorile lipsă din coloana LotFrontage a lui X cu 0.
  • Completează pașii pipeline-ului cu DictVectorizer(sparse=False) pentru "ohe_onestep" și xgb.XGBRegressor() pentru "xgb_model".
  • Creează pipeline-ul folosind Pipeline() și steps.
  • Antrenează pipeline-ul. Nu uita să convertești X într-un format pe care DictVectorizer îl înțelege, apelând metoda to_dict("records") pe X.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import necessary modules
____
____

# Fill LotFrontage missing values with 0
X.LotFrontage = ____

# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
         ("xgb_model", ____)]

# Create the pipeline: xgb_pipeline
xgb_pipeline = ____

# Fit the pipeline
____
Editează și rulează codul