ランダムフォレストモデルを構築する
ここでは、同じクロスバリデーションデータを使って、各分割についてランダムフォレストを構築(train を使用)し、評価(validate を使用)します。回帰モデルと同じクロスバリデーション分割を使うので、2つのモデルの性能を直接比較できます。
Note: 計算時間を適切に保つため、ランダムフォレストの木の数は100本に制限します。ranger() のデフォルトの木の数は500本です。
この演習はコースの一部です
Tidyverse で学ぶ Machine Learning
演習の手順
- 各クロスバリデーション分割について、
trainに含まれるすべての特徴量を用いてlife_expectancyを予測するランダムフォレストをranger()で構築してください。 - 直前に作成したランダムフォレストモデルを使って、
validateの観測に対するlife_expectancyの予測値を格納する新しい列validate_predictedを追加してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
library(ranger)
# Build a random forest model for each fold
cv_models_rf <- cv_data %>%
mutate(model = map(___, ~ranger(formula = ___, data = ___,
num.trees = 100, seed = 42)))
# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>%
mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))