बड़ा ट्री बनाना और उसका मूल्यांकन करना
पहले, आपने एक साधारण decision tree बनाया था जो applicant के credit score और requested loan amount के आधार पर loan outcome predict करता था.
Lending Club के पास applicants के बारे में अतिरिक्त जानकारी है, जैसे home ownership status, employment की अवधि, loan purpose, और पहले हुए bankruptcies. ये अधिक सटीक prediction बनाने में सहायक हो सकती हैं.
उपलब्ध सभी applicant डेटा का उपयोग करके, पहले से बनाए गए random training डेटासेट पर एक अधिक उन्नत lending मॉडल बनाइए. फिर, इस मॉडल का उपयोग testing डेटासेट पर predictions बनाने के लिए कीजिए, ताकि भविष्य की loan applications पर मॉडल के प्रदर्शन का अनुमान लगा सकें.
rpart पैकेज प्री-लोडेड है, और loans_train तथा loans_test डेटासेट बनाए जा चुके हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Supervised Learning: Classification
अभ्यास निर्देश
- training डेटासेट और उपलब्ध सभी predictors का उपयोग करते हुए
rpart()से एक loan मॉडल बनाइए.controlआर्गुमेंट को वैसे ही रहने दें. - testing डेटासेट पर
predict()फंक्शन लागू करके predicted outcomes का एक वेक्टर बनाइए.typeआर्गुमेंट जोड़ना न भूलें. - predicted मानों की तुलना वास्तविक
outcomeमानों से करने के लिएtable()बनाइए. mean()फंक्शन का उपयोग करके predictions की accuracy निकालिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Grow a tree using all of the available applicant data
loan_model <- rpart(___, data = ___, method = "___", control = rpart.control(cp = 0))
# Make predictions on the test dataset
loans_test$pred <- ___
# Examine the confusion matrix
table(___, ___)
# Compute the accuracy on the test dataset
mean(___)