Bắt đầu ngayBắt đầu miễn phí

Xếp chồng mô hình II

Đến giờ, những gì bạn đã làm trong quy trình stacking:

  1. Chia dữ liệu train thành hai phần
  2. Huấn luyện nhiều mô hình trên Phần 1
  3. Tạo dự đoán trên Phần 2
  4. Tạo dự đoán trên dữ liệu test

Giờ mục tiêu của bạn là tạo một mô hình tầng thứ hai, sử dụng các dự đoán từ bước 3 và 4 làm đặc trưng. Nghĩa là mô hình này được huấn luyện trên dữ liệu Phần 2, rồi bạn có thể tạo dự đoán stacking trên dữ liệu test.

Các DataFrame part_2test đã có sẵn trong không gian làm việc của bạn. Các dự đoán của Gradient Boosting và Random Forest được lưu trong các DataFrame này với tên lần lượt là "gb_pred" và "rf_pred".

Bài tập này là một phần của khóa học

Chinh phục cuộc thi Kaggle bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Huấn luyện một mô hình Linear Regression trên dữ liệu Phần 2, sử dụng các dự đoán của mô hình Gradient Boosting và Random Forest làm đặc trưng.
  • Tạo dự đoán trên dữ liệu test, sử dụng các dự đoán của mô hình Gradient Boosting và Random Forest làm đặc trưng.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from sklearn.linear_model import LinearRegression

# Create linear regression model without the intercept
lr = LinearRegression(fit_intercept=False)

# Train 2nd level model on the Part 2 data
lr.____(part_2[['gb_pred', '____']], part_2.fare_amount)

# Make stacking predictions on the test data
test['stacking'] = lr.____(test[['gb_pred', '____']])

# Look at the model coefficients
print(lr.coef_)
Chỉnh sửa và Chạy Mã