Sestavení a vyhodnocení většího stromu
V předchozím cvičení jsi sestavil/a jednoduchý rozhodovací strom, který k předpovědi výsledku půjčky využíval kreditní skóre žadatele a požadovanou výši úvěru.
Lending Club má o žadatelích k dispozici i další informace – například status vlastnictví bydlení, délku zaměstnání, účel půjčky nebo historii bankrotů – které mohou pomoci zpřesnit předpovědi.
Využij všechna dostupná data o žadatelích a postav sofistikovanější model na náhodném trénovacím datasetu vytvořeném dříve. Potom tento model použij k předpovědím na testovacím datasetu a odhadni, jak dobře by fungoval při hodnocení budoucích žádostí o půjčku.
Balíček rpart je předem načtený a datasety loans_train a loans_test jsou připravené k použití.
Toto cvičení je součástí kurzu
Supervised Learning v R: Klasifikace
Pokyny k cvičení
- Pomocí
rpart()sestav model půjček na trénovacím datasetu se všemi dostupnými prediktory. Argumentcontrolopět nechej beze změny. - Aplikuj funkci
predict()na testovací dataset a vytvoř vektor předpovězených výsledků. Nezapomeň na argumenttype. - Vytvoř
table(), která porovná předpovězené hodnoty se skutečnými hodnotami proměnnéoutcome. - Pomocí funkce
mean()vypočítej přesnost předpovědí.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Grow a tree using all of the available applicant data
loan_model <- rpart(___, data = ___, method = "___", control = rpart.control(cp = 0))
# Make predictions on the test dataset
loans_test$pred <- ___
# Examine the confusion matrix
table(___, ___)
# Compute the accuracy on the test dataset
mean(___)