Xây dựng mô hình Hồi quy
Một điểm mạnh của mô-đun PySpark ML là hầu hết các thuật toán đều có thể thử nghiệm mà không cần thay đổi quá nhiều mã. Random Forest Regression là một mô hình ensemble khá đơn giản, dùng bagging để fit. Một mô hình ensemble dựa trên cây khác là Gradient Boosted Trees, mô hình này dùng một cách tiếp cận khác gọi là boosting để fit. Trong bài này, hãy huấn luyện một GBTRegressor.
Bài tập này là một phần của khóa học
Feature Engineering với PySpark
Hướng dẫn bài tập
- Import
GBTRegressortừpyspark.ml.regression, bạn sẽ thấy đây là cùng một mô-đun vớiRandomForestRegressor. - Khởi tạo
GBTRegressorvớifeaturesColđặt thành cột vector đặc trưng của chúng ta làfeatures,labelColđặt thành biến phụ thuộcSALESCLOSEPRICEvàseedngẫu nhiên là42. - Huấn luyện mô hình bằng cách gọi
fit()trêngbtvới dữ liệu huấn luyện đã import,train_df.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)