交差検証による性能を計算する
モデルの目的を達成するために適切な評価指標を選び、それで最適化することが重要です。
このケースでは、退職が予測される従業員を特定するためにモデルを使いたいとします。理想的には、介入できるよう、退職間近の従業員をできるだけ多く捉えられるモデルが望ましいです。これを捉える指標が recall(再現率)です。したがって、ここではモデルの最適化と選択に recall のみを用います。
この演習はコースの一部です
Tidyverse で学ぶ Machine Learning
演習の手順
- 各フォールドについて、実測値と予測値を比較して再現率を計算し、
validate_recall列に代入します。 validate_recall列を表示します。- この列の平均を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Calculate the validate recall for each cross validation fold
cv_perf_recall <- cv_prep_lr %>%
mutate(validate_recall = map2_dbl(___, ___,
~recall(actual = .x, predicted = .y)))
# Print the validate_recall column
cv_perf_recall$___
# Calculate the average of the validate_recall column
___