การเปรียบเทียบค่าพยากรณ์
ในแบบฝึกหัดก่อนหน้า คุณได้ fit โมเดล Linear Regression และ GLM (Logistic) Regression โดยใช้ข้อมูล crab เพื่อพยากรณ์ y จาก width กล่าวคือ เราต้องการพยากรณ์ความน่าจะเป็นที่ปูตัวเมียจะมีปูตัวผู้อาศัยอยู่ใกล้ๆ โดยพิจารณาจากความกว้างของกระดอง
ในแบบฝึกหัดนี้ คุณจะตรวจสอบค่าความน่าจะเป็น (ผลลัพธ์) จากทั้งสองโมเดลเพิ่มเติม และพิจารณาว่า Linear fit เหมาะสมกับปัญหานี้หรือไม่
โดยทั่วไปแล้ว เราจะทดสอบโมเดลกับข้อมูลใหม่ที่โมเดล ยังไม่เคยเห็น ซึ่งเรียกว่าชุดข้อมูล test
ชุดข้อมูล test ถูกสร้างและโหลดไว้ให้แล้วใน workspace โปรดทราบว่าคุณต้องมีค่าทดสอบสำหรับทุกตัวแปรที่อยู่ในโมเดล ซึ่งในตัวอย่างนี้คือ width
ชุดข้อมูล crab ถูกโหลดไว้ใน workspace แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Generalized Linear Models ใน Python
คำแนะนำการฝึกหัด
- ใช้
print()เพื่อดูชุดข้อมูลtest - ใช้ชุดข้อมูล
testคำนวณค่าความน่าจะเป็นที่ประมาณได้โดยเรียก.predict()บนโมเดล Linearmodel_LMแล้วบันทึกผลเป็นpred_lmจากนั้นคำนวณค่าความน่าจะเป็นที่ประมาณได้โดยเรียก.predict()บนโมเดล GLM (Logistic) ที่บันทึกไว้เป็นmodel_GLMแล้วบันทึกผลเป็นpred_glm - ใช้
DataFrame()ของpandasรวมค่าพยากรณ์จากทั้งสองโมเดล แล้วบันทึกเป็นpredictions - รวม
testและpredictionsเข้าด้วยกัน บันทึกเป็นall_dataแล้วใช้print()เพื่อดูall_data
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# View test set
print(____)
# Compute estimated probabilities for linear model: pred_lm
____ = model_LM.____(____)
# Compute estimated probabilities for GLM model: pred_glm
____ = model_GLM.____(____)
# Create dataframe of predictions for linear and GLM model: predictions
____ = pd.DataFrame({'Pred_LM': ____, 'Pred_GLM': ____})
# Concatenate test sample and predictions and view the results
all_data = pd.concat([____, ____], axis = 1)
print(____)