เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Data frame สำหรับ cross-validation

เมื่อแยกข้อมูลส่วนหนึ่งออกไปเป็น ข้อมูลทดสอบ แล้ว ก็สามารถใช้ข้อมูลที่เหลือเพื่อหาโมเดลที่มีประสิทธิภาพดีที่สุดได้

ในแบบฝึกหัดนี้ คุณจะแบ่งข้อมูล training ออกเป็นชุด train-validate จำนวน 5 ชุด โดยใช้ฟังก์ชัน vfold_cv() จากแพ็กเกจ rsample

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Learning ใน Tidyverse

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง data frame สำหรับ cross-validation แบบ 5-fold จาก training_data โดยใช้ vfold_cv() แล้วกำหนดค่าให้กับตัวแปร cv_split
  • เตรียม cv_data โดยเพิ่มสองคอลัมน์ใหม่ใน cv_split:
    • train: เก็บ data frame สำหรับ train โดย map ฟังก์ชัน training() ไปยังคอลัมน์ splits
    • validate: เก็บ data frame สำหรับ validate โดย map ฟังก์ชัน testing() ไปยังคอลัมน์ splits

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
แก้ไขและรันโค้ด