เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การสร้างชุดข้อมูลทดสอบแบบสุ่ม

ก่อนสร้างโมเดลสินเชื่อที่ซับซ้อนขึ้น สิ่งสำคัญคือต้องแยกข้อมูลสินเชื่อบางส่วนไว้ เพื่อจำลองว่าโมเดลจะทำนายผลลัพธ์ของผู้สมัครสินเชื่อในอนาคตได้ดีเพียงใด

ดังที่แสดงในภาพด้านล่าง สามารถใช้ข้อมูล 75% สำหรับการฝึก และอีก 25% สำหรับการทดสอบโมเดลได้

ฟังก์ชัน sample() ใช้สุ่มเลือกแถวสำหรับชุดข้อมูลฝึก เพียงระบุจำนวนข้อมูลทั้งหมดและจำนวนที่ต้องการใช้ฝึก

จากนั้นนำเวกเตอร์ของ row ID ที่ได้ไปแบ่ง loans เป็นชุดข้อมูลฝึกและชุดข้อมูลทดสอบ ชุดข้อมูล loans พร้อมให้ใช้งานแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Supervised Learning in R: Classification

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ใช้ฟังก์ชัน nrow() เพื่อดูจำนวนข้อมูลทั้งหมดในชุดข้อมูล loans และคำนวณจำนวนที่ต้องการสำหรับการสุ่ม 75%
  • ใช้ฟังก์ชัน sample() สร้างเวกเตอร์จำนวนเต็มของ row ID สำหรับกลุ่มตัวอย่าง 75% โดยอาร์กิวเมนต์แรกของ sample() คือจำนวนแถวทั้งหมดในชุดข้อมูล และอาร์กิวเมนต์ที่สองคือจำนวนแถวที่ต้องการในชุดข้อมูลฝึก
  • แบ่งข้อมูล loans โดยใช้ row ID เพื่อสร้างชุดข้อมูลฝึก แล้วบันทึกเป็น loans_train
  • แบ่งข้อมูล loans อีกครั้ง แต่คราวนี้เลือกเฉพาะแถวที่ ไม่ได้ อยู่ใน sample_rows แล้วบันทึกเป็น loans_test

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Determine the number of rows for training


# Create a random sample of row IDs
sample_rows <- sample(___, ___)

# Create the training dataset
loans_train <- loans[___]

# Create the test dataset
loans_test <- loans[___]
แก้ไขและรันโค้ด