アルゴリズムの評価と比較
GBTRegressor で新しいモデルを作成したので、ベースラインの RandomForestRegressor と比較してみましょう。両モデルの予測値を実測データと照合し、RMSE と R^2 を計算します。
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
- 後で使えるように、
pyspark.ml.evaluationからRegressionEvaluatorをインポートします。 RegressionEvaluatorを初期化し、labelColには実測データであるSALESCLOSEPRICE、predictionColには予測データであるPrediction_Priceを設定します。- 指標を計算するには、
evaluatorのevaluateを予測値predsに対して呼び出し、キーをevaluator.metricName、値をrmseとする辞書を作成します。r2指標についても同様に行います。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))