建立一個回歸模型
PySpark 的 ML 模組有個很棒的特性:多數演算法都能在幾乎不改動程式碼的情況下嘗試與比較。隨機森林回歸是一種相對簡單的集成模型,使用 bagging 來擬合。另一種以樹為基礎的集成模型是梯度提升樹(Gradient Boosted Trees),它使用稱為 boosting 的不同方法來擬合。在這個練習中,讓我們訓練一個 GBTRegressor。
本練習屬於課程
使用 PySpark 進行特徵工程
練習說明
- 從
pyspark.ml.regression匯入GBTRegressor,你會注意到它和RandomForestRegressor在同一個模組。 - 建立
GBTRegressor,將featuresCol設為特徵的向量欄位features,labelCol設為應變數SALESCLOSEPRICE,並將隨機seed設為42。 - 透過在
gbt上呼叫fit(),並使用匯入的訓練資料train_df,來訓練模型。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)