Data frame สำหรับ cross-validation
เมื่อแยกข้อมูลส่วนหนึ่งออกไปเป็น ข้อมูลทดสอบ แล้ว ก็สามารถใช้ข้อมูลที่เหลือเพื่อหาโมเดลที่มีประสิทธิภาพดีที่สุดได้
ในแบบฝึกหัดนี้ คุณจะแบ่งข้อมูล training ออกเป็นชุด train-validate จำนวน 5 ชุด โดยใช้ฟังก์ชัน vfold_cv() จากแพ็กเกจ rsample
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning ใน Tidyverse
คำแนะนำการฝึกหัด
- สร้าง data frame สำหรับ cross-validation แบบ 5-fold จาก
training_dataโดยใช้vfold_cv()แล้วกำหนดค่าให้กับตัวแปรcv_split - เตรียม
cv_dataโดยเพิ่มสองคอลัมน์ใหม่ในcv_split:train: เก็บ data frame สำหรับ train โดย map ฟังก์ชันtraining()ไปยังคอลัมน์splitsvalidate: เก็บ data frame สำหรับ validate โดย map ฟังก์ชันtesting()ไปยังคอลัมน์splits
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)