or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Spark เป็น Framework สำหรับการทำงานกับ Big Data ในบทนี้จะได้รู้จักพื้นฐานของ Spark และ Machine Learning จากนั้นจะได้เรียนรู้วิธีเชื่อมต่อกับ Spark ด้วย Python และโหลดข้อมูล CSV
เมื่อคุ้นเคยกับการนำข้อมูลเข้า Spark แล้ว จะก้าวไปสู่การสร้างโมเดลจำแนกประเภท 2 แบบ ได้แก่ Decision Tree และ Logistic Regression พร้อมทั้งเรียนรู้แนวทางการเตรียมข้อมูลหลายรูปแบบ
ต่อมาจะได้เรียนรู้การสร้างโมเดล Linear Regression รวมถึงวิธีเพิ่มคุณค่าให้ข้อมูลด้วยการสร้าง Predictor ใหม่ และแนวทางที่เชื่อถือได้สำหรับการคัดเลือก Predictor ที่เกี่ยวข้องมากที่สุด
แบบฝึกหัดปัจจุบัน
ในบทสุดท้ายจะได้เรียนรู้วิธีทำให้โมเดลมีประสิทธิภาพมากขึ้น โดยใช้ Pipeline เพื่อให้โค้ดอ่านง่ายและดูแลรักษาได้สะดวกขึ้น จากนั้นจะใช้ Cross-Validation เพื่อทดสอบโมเดลและเลือก Parameter ที่เหมาะสม และปิดท้ายด้วยการทดลองใช้โมเดลแบบ Ensemble 2 ประเภท