始める無料で始める

アルゴリズムの評価と比較

GBTRegressor で新しいモデルを作成したので、ベースラインの RandomForestRegressor と比較してみましょう。両モデルの予測値を実測データと照合し、RMSE と R^2 を計算します。

この演習はコースの一部です

PySparkで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • 後で使えるように、pyspark.ml.evaluation から RegressionEvaluator をインポートします。
  • RegressionEvaluator を初期化し、labelCol には実測データである SALESCLOSEPRICEpredictionCol には予測データである Prediction_Price を設定します。
  • 指標を計算するには、evaluatorevaluate を予測値 preds に対して呼び出し、キーを evaluator.metricName、値を rmse とする辞書を作成します。r2 指標についても同様に行います。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from ____ import ____

# Select columns to compute test error
evaluator = ____(____=____, 
                                ____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
  # Create evaluation metrics
  rmse = evaluator.____(____, {____: ____})
  r2 = evaluator.____(____, {____: ____})
  
  # Print Model Metrics
  print(key + ' RMSE: ' + str(rmse))
  print(key + ' R^2: ' + str(r2))
コードを編集して実行