ฝึกโมเดล
ถึงเวลาฝึกโมเดลและเลือกโมเดลที่ดีที่สุดแล้ว!
อย่างไรก็ตาม cross validation เป็นกระบวนการที่ใช้ทรัพยากรการคำนวณสูงมาก การฝึกโมเดลทั้งหมดจะใช้เวลานานเกินไปบน DataCamp
หากต้องการรันในเครื่องของคุณเอง ให้ใช้โค้ดนี้:
# Fit cross validation models
models = cv.fit(training)
# Extract the best model
best_lr = models.bestModel
ขอให้จำไว้ว่าข้อมูลสำหรับฝึกโมเดลใช้ชื่อว่า training และใช้ lr ในการฝึก logistic regression โดย cross validation ได้เลือกค่าพารามิเตอร์ regParam=0 และ elasticNetParam=0 ว่าเหมาะสมที่สุด ซึ่งเป็นค่าดีฟอลต์อยู่แล้ว จึงไม่จำเป็นต้องปรับค่าใดๆ ใน lr ก่อนฝึกโมเดล
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
พื้นฐาน PySpark
คำแนะนำการฝึกหัด
- สร้าง
best_lrโดยเรียกlr.fit()กับข้อมูลtraining - พิมพ์
best_lrเพื่อตรวจสอบว่าเป็น object ของคลาสLogisticRegressionModel
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Call lr.fit()
best_lr = ____
# Print best_lr
print(____)