เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Cross validation

ในแบบฝึกหัดถัดไปจะได้ปรับแต่ง logistic regression โมเดลโดยใช้กระบวนการที่เรียกว่า k-fold cross validation ซึ่งเป็นวิธีประมาณประสิทธิภาพของโมเดลบนข้อมูลที่ยังไม่เคยเห็น (เช่น DataFrame test ของคุณ)

วิธีนี้ทำงานโดยการแบ่งข้อมูลฝึกสอนออกเป็นพาร์ติชันต่าง ๆ จำนวนพาร์ติชันขึ้นอยู่กับการตั้งค่า แต่ในคอร์สนี้จะใช้ค่าเริ่มต้นของ PySpark ซึ่งคือสาม เมื่อแบ่งข้อมูลแล้ว พาร์ติชันหนึ่งจะถูกแยกไว้ และโมเดลจะถูก fit กับพาร์ติชันที่เหลือ จากนั้นวัดค่าความผิดพลาดกับพาร์ติชันที่แยกไว้ กระบวนการนี้จะทำซ้ำสำหรับทุกพาร์ติชัน เพื่อให้ข้อมูลทุกบล็อกได้ถูกแยกออกและใช้เป็นชุดทดสอบครบหนึ่งครั้ง จากนั้นนำค่าความผิดพลาดของแต่ละพาร์ติชันมาหาค่าเฉลี่ย ซึ่งเรียกว่า cross validation error ของโมเดล และถือเป็นค่าประมาณที่ดีของความผิดพลาดจริงบนข้อมูลที่แยกออกมา

จะใช้ cross validation ในการเลือก hyperparameter โดยสร้าง grid ของคู่ค่าที่เป็นไปได้ของ hyperparameter สองตัว ได้แก่ elasticNetParam และ regParam แล้วใช้ cross validation error เปรียบเทียบโมเดลต่าง ๆ เพื่อเลือกโมเดลที่ดีที่สุด

Cross validation ช่วยให้ประมาณค่าอะไรได้บ้าง?

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

พื้นฐาน PySpark

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง

เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา

เริ่มแบบฝึกหัด