การรวมวิธีการประมวลผลล่วงหน้าหลายแบบ
อาร์กิวเมนต์ preProcess ใน train() ไม่ได้จำกัดแค่การเติมค่าที่หายไปเท่านั้น แต่ยังรองรับเทคนิค preProcess อีกหลากหลายแบบที่ช่วยให้การทำงานของนักวิทยาศาสตร์ข้อมูลสะดวกขึ้นมาก สามารถดูรายการทั้งหมดได้โดยพิมพ์ ?preProcess แล้วอ่านหน้าช่วยเหลือของฟังก์ชันนี้
เทคนิคการประมวลผลล่วงหน้าชุดหนึ่งที่มีประโยชน์อย่างมากสำหรับการ fit โมเดล regression คือ การทำ standardization ซึ่งประกอบด้วยการ centering และ scaling โดยขั้นแรกจะ center ด้วยการลบค่าเฉลี่ยของแต่ละคอลัมน์ออกจากทุกค่าในคอลัมน์นั้น จากนั้น scale ด้วยการหารด้วยส่วนเบี่ยงเบนมาตรฐาน
การทำ standardization จะแปลงข้อมูลให้แต่ละคอลัมน์มีค่าเฉลี่ยเป็น 0 และส่วนเบี่ยงเบนมาตรฐานเป็น 1 ซึ่งช่วยให้โมเดล regression หาคำตอบที่ดีได้ง่ายขึ้น
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning ด้วย caret ใน R
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Fit glm with median imputation
model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print model