ランダムフォレスト:予測
次は、ランダムフォレストモデルを使って予測を行いましょう。構文は勾配ブースティング木モデルと同じです。
この演習はコースの一部です
sparklyr を使った Spark 入門(R)
演習の手順
Spark 接続は spark_conn として作成済みです。Spark に保存されているトレーニング用とテスト用のデータセットに対応するティブルは、それぞれ track_data_to_model_tbl と track_data_to_predict_tbl として事前定義されています。ランダムフォレストモデルは random_forest_model として事前定義されています。
- テストデータに対するモデルの予測結果を格納する変数
predictedを定義します。- モデルとテストデータを引数として
ml_predict()を呼び出します。この関数はテストデータセットに対する予測を生成し、predictionという新しい列として追加します。
- モデルとテストデータを引数として
- 予測値と実際の値を比較できるよう、変数
responsesを定義します。- 応答列
yearを選択します。 - 結果を収集します。
mutate()を使って、predictedで得られた予測値を追加します。
- 応答列
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___