ฝึกโมเดล Random Forest
จากที่เห็นในวิดีโอ โมเดล random forest มีความยืดหยุ่นสูงกว่าโมเดลเชิงเส้นมาก สามารถจับความสัมพันธ์แบบไม่เชิงเส้นที่ซับซ้อนได้ รวมถึงตรวจจับ interaction ระหว่างตัวแปรได้โดยอัตโนมัติ โมเดลประเภทนี้มักให้ผลลัพธ์ที่ดีมากกับข้อมูลจริง ดังนั้นมาลองใช้กับชุดข้อมูลคุณภาพไวน์กัน โดยมีเป้าหมายเพื่อทำนายคุณภาพของไวน์ที่ประเมินโดยมนุษย์ จากคุณสมบัติทางเคมีและกายภาพที่วัดด้วยเครื่องจักร
การฝึกโมเดล random forest ทำได้ในลักษณะเดียวกับการฝึกโมเดล generalized linear regression ที่ทำไปในบทก่อนหน้า เพียงเปลี่ยน argument method ในฟังก์ชัน train เป็น "ranger" แพ็กเกจ ranger เป็นการเขียนใหม่ของแพ็กเกจ randomForest ดั้งเดิมของ R ซึ่งฝึกโมเดลได้เร็วกว่ามาก แต่ให้ผลลัพธ์ที่ใกล้เคียงกันเกือบทุกประการ สำหรับผู้เริ่มต้น แนะนำให้ใช้แพ็กเกจ ranger สำหรับการสร้างโมเดล random forest
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning ด้วย caret ใน R
คำแนะนำการฝึกหัด
- ฝึกโมเดล random forest ชื่อ
modelบนชุดข้อมูลคุณภาพไวน์wineโดยให้qualityเป็นตัวแปรตอบสนอง และตัวแปรอื่นทั้งหมดเป็นตัวแปรอธิบาย - ใช้
method = "ranger" - ใช้
tuneLengthเท่ากับ 1 - ใช้ CV จำนวน 5 fold
- แสดงผล
modelในคอนโซล
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Fit random forest: model
model <- train(
___,
tuneLength = ___,
data = ___,
method = ___,
trControl = trainControl(
method = "cv",
number = ___,
verboseIter = TRUE
)
)
# Print model to console