Bắt đầu ngayBắt đầu miễn phí

Xây dựng mô hình Hồi quy

Một điểm mạnh của mô-đun PySpark ML là hầu hết các thuật toán đều có thể thử nghiệm mà không cần thay đổi quá nhiều mã. Random Forest Regression là một mô hình ensemble khá đơn giản, dùng bagging để fit. Một mô hình ensemble dựa trên cây khác là Gradient Boosted Trees, mô hình này dùng một cách tiếp cận khác gọi là boosting để fit. Trong bài này, hãy huấn luyện một GBTRegressor.

Bài tập này là một phần của khóa học

Feature Engineering với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Import GBTRegressor từ pyspark.ml.regression, bạn sẽ thấy đây là cùng một mô-đun với RandomForestRegressor.
  • Khởi tạo GBTRegressor với featuresCol đặt thành cột vector đặc trưng của chúng ta là features, labelCol đặt thành biến phụ thuộc SALESCLOSEPRICEseed ngẫu nhiên là 42.
  • Huấn luyện mô hình bằng cách gọi fit() trên gbt với dữ liệu huấn luyện đã import, train_df.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Chỉnh sửa và Chạy Mã