Bắt đầu ngayBắt đầu miễn phí

Tiền xử lý trong một pipeline

Giờ bạn đã biết từng bước cần làm để xử lý đúng dữ liệu nhà ở Ames, hãy dùng cách tiếp cận DictVectorizer gọn gàng và súc tích hơn, đặt nó cùng với XGBoostRegressor bên trong một pipeline của scikit-learn.

Bài tập này là một phần của khóa học

Gradient Boosting Cực Mạnh với XGBoost

Xem khóa học

Hướng dẫn bài tập

  • Import DictVectorizer từ sklearn.feature_extractionPipeline từ sklearn.pipeline.
  • Điền các giá trị còn thiếu trong cột LotFrontage của X bằng 0.
  • Hoàn thiện các bước của pipeline với DictVectorizer(sparse=False) cho "ohe_onestep"xgb.XGBRegressor() cho "xgb_model".
  • Tạo pipeline bằng Pipeline()steps.
  • Fit Pipeline. Đừng quên chuyển X sang định dạng mà DictVectorizer hiểu bằng cách gọi phương thức to_dict("records") trên X.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import necessary modules
____
____

# Fill LotFrontage missing values with 0
X.LotFrontage = ____

# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
         ("xgb_model", ____)]

# Create the pipeline: xgb_pipeline
xgb_pipeline = ____

# Fit the pipeline
____
Chỉnh sửa và Chạy Mã