より大きな木の構築と評価
これまでに、申請者のクレジットスコアと希望借入額を使って、ローン結果を予測するシンプルな決定木を作成しました。
Lending Club には、持ち家の有無、勤続年数、借入目的、過去の破産歴など、より正確な予測に役立ちそうな追加情報があります。
利用可能な申請者データをすべて用いて、以前に作成したランダムな訓練データセットから、より高度な貸出モデルを構築しましょう。次に、このモデルをテストデータセットに適用して予測を行い、今後のローン申請に対するモデル性能を見積もってください。
rpart パッケージはあらかじめ読み込まれており、loans_train と loans_test の各データセットも用意されています。
この演習はコースの一部です
Rで学ぶSupervised Learning:分類
演習の手順
- 訓練データセットと利用可能なすべての説明変数を使って、
rpart()でローンモデルを構築します。今回もcontrol引数は変更しないでください。 - テストデータセットに
predict()関数を適用して、予測された結果のベクトルを作成します。type引数を忘れないでください。 - 予測値と実際の
outcomeを比較するために、table()を作成します。 mean()関数を使って、予測の正解率を計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Grow a tree using all of the available applicant data
loan_model <- rpart(___, data = ___, method = "___", control = rpart.control(cp = 0))
# Make predictions on the test dataset
loans_test$pred <- ___
# Examine the confusion matrix
table(___, ___)
# Compute the accuracy on the test dataset
mean(___)