始める無料で始める

回帰モデルを構築する

PySpark の ML モジュールの優れている点は、ほとんどのアルゴリズムをコードを大きく変えずに試して評価できることです。Random Forest Regression は、バギングで学習する比較的シンプルなアンサンブルモデルです。もう一つの木ベースのアンサンブルモデルに Gradient Boosted Trees があり、こちらはブースティングという別の手法で学習します。この演習では GBTRegressor を学習してみましょう。

この演習はコースの一部です

PySparkで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • RandomForestRegressor と同じモジュールである pyspark.ml.regression から GBTRegressor をインポートします。
  • GBTRegressor をインスタンス化し、featuresCol は特徴量のベクトル列 featureslabelCol は目的変数 SALESCLOSEPRICE、ランダムな seed42 に設定します。
  • インポート済みの学習データ train_df を使い、gbt に対して fit() を呼び出してモデルを学習します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
コードを編集して実行