สร้างและประเมินต้นไม้ขนาดใหญ่ขึ้น
ในแบบฝึกหัดก่อนหน้า คุณได้สร้าง decision tree อย่างง่ายที่ใช้คะแนนเครดิตและจำนวนเงินกู้ที่ขอเพื่อพยากรณ์ผลการอนุมัติสินเชื่อ
Lending Club มีข้อมูลเพิ่มเติมเกี่ยวกับผู้สมัคร เช่น สถานะการเป็นเจ้าของบ้าน ระยะเวลาการจ้างงาน วัตถุประสงค์ของสินเชื่อ และประวัติการล้มละลายในอดีต ซึ่งอาจเป็นประโยชน์ในการสร้างการพยากรณ์ที่แม่นยำยิ่งขึ้น
โดยใช้ข้อมูลผู้สมัครที่มีอยู่ทั้งหมด ให้สร้างโมเดลสินเชื่อที่ซับซ้อนขึ้นโดยใช้ชุดข้อมูลฝึกแบบสุ่มที่สร้างไว้ก่อนหน้า จากนั้นใช้โมเดลนี้พยากรณ์บนชุดข้อมูลทดสอบ เพื่อประเมินประสิทธิภาพของโมเดลสำหรับใบสมัครสินเชื่อในอนาคต
แพ็กเกจ rpart ถูกโหลดไว้ล่วงหน้าแล้ว และชุดข้อมูล loans_train กับ loans_test ได้ถูกสร้างขึ้นพร้อมใช้งาน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Supervised Learning in R: Classification
คำแนะนำการฝึกหัด
- ใช้
rpart()เพื่อสร้างโมเดลสินเชื่อโดยใช้ชุดข้อมูลฝึกและ predictor ทั้งหมดที่มีอยู่ เช่นเดิม ไม่ต้องปรับ argumentcontrol - นำฟังก์ชัน
predict()ไปใช้กับชุดข้อมูลทดสอบ เพื่อสร้างเวกเตอร์ของผลลัพธ์ที่พยากรณ์ได้ อย่าลืมระบุ argumenttypeด้วย - สร้าง
table()เพื่อเปรียบเทียบค่าที่พยากรณ์ได้กับค่าoutcomeจริง - คำนวณความแม่นยำของการพยากรณ์โดยใช้ฟังก์ชัน
mean()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Grow a tree using all of the available applicant data
loan_model <- rpart(___, data = ___, method = "___", control = rpart.control(cp = 0))
# Make predictions on the test dataset
loans_test$pred <- ___
# Examine the confusion matrix
table(___, ___)
# Compute the accuracy on the test dataset
mean(___)