คำนวณค่าพยากรณ์
ในทางปฏิบัติ เรามักต้องการใช้โมเดล logistic regression ที่ฝึกแล้วเพื่อประมาณค่าความน่าจะเป็น และสร้าง confidence interval สำหรับค่าประมาณเหล่านั้น โดยใช้ชุดข้อมูล wells และโมเดล 'switch ~ arsenic' สมมติว่ามีข้อมูลใหม่ wells_test ที่ไม่ได้เป็นส่วนหนึ่งของชุดข้อมูลฝึก และต้องการพยากรณ์ความน่าจะเป็นที่จะเปลี่ยนไปใช้บ่อน้ำที่ปลอดภัยที่ใกล้ที่สุด
สามารถทำได้โดยใช้เมธอด .predict()
โปรดทราบว่า .predict() รับอาร์กิวเมนต์หลายตัว ได้แก่:
exog- ข้อมูลใหม่ (ชุดข้อมูลทดสอบ)transform = True- ส่งสูตรของโมเดลy ~ xไปยังข้อมูล
หากไม่ได้กำหนด exog ค่าความน่าจะเป็นจะถูกคำนวณบนชุดข้อมูลฝึก
โมเดล wells_fit และชุดข้อมูล wells กับ wells_test ถูกโหลดไว้ล่วงหน้าในพื้นที่ทำงานแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Generalized Linear Models ใน Python
คำแนะนำการฝึกหัด
- ใช้โมเดล
wells_fitที่ฝึกแล้วเพื่อคำนวณค่าพยากรณ์บนข้อมูลทดสอบwells_testและบันทึกผลลัพธ์เป็นprediction - เพิ่ม
predictionเข้าไปใน dataframewells_testที่มีอยู่ และตั้งชื่อคอลัมน์ว่าprediction - ใช้
print()แสดง 5 แถวแรกของwells_testโดยเลือกคอลัมน์switch,arsenicและpredictionใช้ฟังก์ชันhead()ของ pandas เพื่อดูเฉพาะ 5 แถวแรก
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Compute predictions for the test sample wells_test and save as prediction
prediction = ____.predict(exog = ____)
# Add prediction to the existing data frame wells_test and assign column name prediction
____[____] = ____
# Examine the first 5 computed predictions
print(____[[____, ____, ____]].head())