開始使用免費開始

建立一個回歸模型

PySpark 的 ML 模組有個很棒的特性:多數演算法都能在幾乎不改動程式碼的情況下嘗試與比較。隨機森林回歸是一種相對簡單的集成模型,使用 bagging 來擬合。另一種以樹為基礎的集成模型是梯度提升樹(Gradient Boosted Trees),它使用稱為 boosting 的不同方法來擬合。在這個練習中,讓我們訓練一個 GBTRegressor

本練習屬於課程

使用 PySpark 進行特徵工程

檢視課程

練習說明

  • pyspark.ml.regression 匯入 GBTRegressor,你會注意到它和 RandomForestRegressor 在同一個模組。
  • 建立 GBTRegressor,將 featuresCol 設為特徵的向量欄位 featureslabelCol 設為應變數 SALESCLOSEPRICE,並將隨機 seed 設為 42
  • 透過在 gbt 上呼叫 fit(),並使用匯入的訓練資料 train_df,來訓練模型。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
編輯並執行程式碼