การสร้างชุดข้อมูลทดสอบแบบสุ่ม
ก่อนสร้างโมเดลสินเชื่อที่ซับซ้อนขึ้น สิ่งสำคัญคือต้องแยกข้อมูลสินเชื่อบางส่วนไว้ เพื่อจำลองว่าโมเดลจะทำนายผลลัพธ์ของผู้สมัครสินเชื่อในอนาคตได้ดีเพียงใด
ดังที่แสดงในภาพด้านล่าง สามารถใช้ข้อมูล 75% สำหรับการฝึก และอีก 25% สำหรับการทดสอบโมเดลได้

ฟังก์ชัน sample() ใช้สุ่มเลือกแถวสำหรับชุดข้อมูลฝึก เพียงระบุจำนวนข้อมูลทั้งหมดและจำนวนที่ต้องการใช้ฝึก
จากนั้นนำเวกเตอร์ของ row ID ที่ได้ไปแบ่ง loans เป็นชุดข้อมูลฝึกและชุดข้อมูลทดสอบ ชุดข้อมูล loans พร้อมให้ใช้งานแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Supervised Learning in R: Classification
คำแนะนำการฝึกหัด
- ใช้ฟังก์ชัน
nrow()เพื่อดูจำนวนข้อมูลทั้งหมดในชุดข้อมูลloansและคำนวณจำนวนที่ต้องการสำหรับการสุ่ม 75% - ใช้ฟังก์ชัน
sample()สร้างเวกเตอร์จำนวนเต็มของ row ID สำหรับกลุ่มตัวอย่าง 75% โดยอาร์กิวเมนต์แรกของsample()คือจำนวนแถวทั้งหมดในชุดข้อมูล และอาร์กิวเมนต์ที่สองคือจำนวนแถวที่ต้องการในชุดข้อมูลฝึก - แบ่งข้อมูล
loansโดยใช้ row ID เพื่อสร้างชุดข้อมูลฝึก แล้วบันทึกเป็นloans_train - แบ่งข้อมูล
loansอีกครั้ง แต่คราวนี้เลือกเฉพาะแถวที่ ไม่ได้ อยู่ในsample_rowsแล้วบันทึกเป็นloans_test
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]