最終的な分類モデルを構築する
ロジスティック回帰モデル(0.4)と、最も高い性能を示したランダムフォレストモデル(0.2)の再現率(recall)を比較した結果、より良いモデルはロジスティック回帰モデルであると分かりました。この演習では、すべてのtrainデータを使ってロジスティック回帰モデルを構築し、このモデルのtest性能を評価するために必要なベクトルを準備します。
この演習はコースの一部です
Tidyverse で学ぶ Machine Learning
演習の手順
training_dataに含まれる利用可能なすべての特徴量を使って、Attritionを予測するロジスティック回帰モデルを構築します。- 実際のテスト値の二値ベクトル
test_actualを準備します。 - 予測確率が 0.5 より大きい場合に
TRUEとみなす二値の予測ベクトルを作成し、test_predictedとして保存します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Build the logistic regression model using all training data
best_model <- glm(formula = ___,
data = ___, family = "binomial")
# Prepare binary vector of actual Attrition values for testing_data
test_actual <- testing_data$___ == "___"
# Prepare binary vector of predicted Attrition values for testing_data
test_predicted <- predict(___, ___, type = "response") > ___