Construirea și evaluarea unui arbore mai complex
Anterior, ai creat un arbore de decizie simplu care folosea scorul de credit al solicitantului și suma împrumutului cerut pentru a prezice rezultatul creditului.
Lending Club deține informații suplimentare despre solicitanți, cum ar fi statutul de proprietar al locuinței, durata angajării, scopul împrumutului și falimentele anterioare — toate acestea pot fi utile pentru predicții mai precise.
Folosind toate datele disponibile despre solicitanți, construiește un model de creditare mai sofisticat cu ajutorul setului de antrenament creat anterior. Aplică apoi acest model pe setul de testare pentru a estima performanța lui pe viitoare cereri de împrumut.
Pachetul rpart a fost preîncărcat, iar seturile de date loans_train și loans_test au fost deja create.
Acest exercițiu face parte din cursul
Supervised Learning în R: Clasificare
Instrucțiuni pentru exercițiu
- Folosește
rpart()pentru a construi un model de creditare pe baza setului de antrenament și a tuturor predictorilor disponibili. Lasă argumentulcontrolnemodificat. - Aplică funcția
predict()pe setul de testare pentru a crea un vector cu rezultatele prezise. Nu uita de argumentultype. - Creează un
table()pentru a compara valorile prezise cu valorile reale din coloanaoutcome. - Calculează acuratețea predicțiilor folosind funcția
mean().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Grow a tree using all of the available applicant data
loan_model <- rpart(___, data = ___, method = "___", control = rpart.control(cp = 0))
# Make predictions on the test dataset
loans_test$pred <- ___
# Examine the confusion matrix
table(___, ___)
# Compute the accuracy on the test dataset
mean(___)