Machine Learning Pipelines
ในสองบทถัดไป เราจะพาไปทำความเข้าใจทุกขั้นตอนของ machine learning pipeline ตั้งแต่การนำเข้าข้อมูลไปจนถึงการประเมินโมเดล ไปเริ่มกันเลย!
หัวใจสำคัญของโมดูล pyspark.ml คือคลาส Transformer และ Estimator ซึ่งคลาสอื่นๆ เกือบทั้งหมดในโมดูลนี้ทำงานในลักษณะเดียวกับสองคลาสพื้นฐานนี้
คลาส Transformer มีเมธอด .transform() ที่รับ DataFrame และคืนค่าเป็น DataFrame ใหม่ โดยมักเป็น DataFrame เดิมที่มีคอลัมน์ใหม่เพิ่มเข้ามา ตัวอย่างเช่น คลาส Bucketizer สำหรับแบ่งข้อมูลต่อเนื่องออกเป็นช่วงกลุ่ม หรือคลาส PCA สำหรับลดมิติของชุดข้อมูลด้วย principal component analysis
คลาส Estimator ทุกคลาสมีเมธอด .fit() ซึ่งรับ DataFrame เช่นกัน แต่แทนที่จะคืนค่าเป็น DataFrame กลับคืนค่าเป็น object ของโมเดลแทน เช่น StringIndexerModel สำหรับนำข้อมูลประเภท categorical ที่บันทึกเป็น string มาใช้ในโมเดล หรือ RandomForestModel ที่ใช้อัลกอริทึม random forest สำหรับการจำแนกประเภทหรือการถดถอย
ข้อใดต่อไปนี้ ไม่ เป็นความจริงเกี่ยวกับการเรียนรู้ของเครื่องใน Spark?
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
พื้นฐาน PySpark
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด