Tiền xử lý trong một pipeline
Giờ bạn đã biết từng bước cần làm để xử lý đúng dữ liệu nhà ở Ames, hãy dùng cách tiếp cận DictVectorizer gọn gàng và súc tích hơn, đặt nó cùng với XGBoostRegressor bên trong một pipeline của scikit-learn.
Bài tập này là một phần của khóa học
Gradient Boosting Cực Mạnh với XGBoost
Hướng dẫn bài tập
- Import
DictVectorizertừsklearn.feature_extractionvàPipelinetừsklearn.pipeline. - Điền các giá trị còn thiếu trong cột
LotFrontagecủaXbằng0. - Hoàn thiện các bước của pipeline với
DictVectorizer(sparse=False)cho"ohe_onestep"vàxgb.XGBRegressor()cho"xgb_model". - Tạo pipeline bằng
Pipeline()vàsteps. - Fit
Pipeline. Đừng quên chuyểnXsang định dạng màDictVectorizerhiểu bằng cách gọi phương thứcto_dict("records")trênX.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import necessary modules
____
____
# Fill LotFrontage missing values with 0
X.LotFrontage = ____
# Setup the pipeline steps: steps
steps = [("ohe_onestep", ____),
("xgb_model", ____)]
# Create the pipeline: xgb_pipeline
xgb_pipeline = ____
# Fit the pipeline
____