始める無料で始める

ランダムフォレスト:予測

次は、ランダムフォレストモデルを使って予測を行いましょう。構文は勾配ブースティング木モデルと同じです。

この演習はコースの一部です

sparklyr を使った Spark 入門(R)

コースを見る

演習の手順

Spark 接続は spark_conn として作成済みです。Spark に保存されているトレーニング用とテスト用のデータセットに対応するティブルは、それぞれ track_data_to_model_tbltrack_data_to_predict_tbl として事前定義されています。ランダムフォレストモデルは random_forest_model として事前定義されています。

  • テストデータに対するモデルの予測結果を格納する変数 predicted を定義します。
    • モデルとテストデータを引数として ml_predict() を呼び出します。この関数はテストデータセットに対する予測を生成し、prediction という新しい列として追加します。
  • 予測値と実際の値を比較できるよう、変数 responses を定義します。
    • 応答列 year を選択します。
    • 結果を収集します。
    • mutate() を使って、predicted で得られた予測値を追加します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model

# Predict the responses for the testing data
predicted <- ml_predict(
      ___,
      ___) %>% pull(prediction)

# Create a response vs. actual dataset
responses <- ___
コードを編集して実行