回帰モデルを構築する
PySpark の ML モジュールの優れている点は、ほとんどのアルゴリズムをコードを大きく変えずに試して評価できることです。Random Forest Regression は、バギングで学習する比較的シンプルなアンサンブルモデルです。もう一つの木ベースのアンサンブルモデルに Gradient Boosted Trees があり、こちらはブースティングという別の手法で学習します。この演習では GBTRegressor を学習してみましょう。
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
RandomForestRegressorと同じモジュールであるpyspark.ml.regressionからGBTRegressorをインポートします。GBTRegressorをインスタンス化し、featuresColは特徴量のベクトル列features、labelColは目的変数SALESCLOSEPRICE、ランダムなseedは42に設定します。- インポート済みの学習データ
train_dfを使い、gbtに対してfit()を呼び出してモデルを学習します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)