การกระจายของค่าความคลาดเคลื่อน
แทบไม่มีกระบวนการใดในโลกจริงที่สามารถพยากรณ์ได้อย่างสมบูรณ์แบบ ผลลัพธ์ที่พึงประสงค์คือค่าความคลาดเคลื่อนควรมีการกระจายแบบปกติ (normal distribution) ซึ่งหมายความว่าบางค่าจริงจะสูงกว่าค่าพยากรณ์ และบางค่าจะต่ำกว่า กล่าวคือ ค่าความคลาดเคลื่อน (ผลต่างระหว่างค่าจริงกับค่าพยากรณ์) จะกระจายตัวแบบสุ่มรอบศูนย์
ในแบบฝึกหัดนี้ จะได้วิเคราะห์ผลลัพธ์จากโมเดลเชิงเส้นที่สร้างไว้ล่วงหน้า ซึ่งใช้พยากรณ์เงินเดือนของเจ้าหน้าที่ตำรวจ จากนั้นตรวจสอบว่าค่าความคลาดเคลื่อนมีการกระจายแบบปกติโดยประมาณหรือไม่ โดยค่าพยากรณ์จะอยู่ในลิสต์ preds และเงินเดือนจริงจะอยู่ในลิสต์ salaries
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
พื้นฐานการอนุมานทางสถิติด้วย Python
คำแนะนำการฝึกหัด
- คำนวณค่าความคลาดเคลื่อนโดยนำเงินเดือนจริงลบด้วยเงินเดือนที่พยากรณ์ได้
- แสดงค่าความคลาดเคลื่อนในรูปแบบฮิสโตแกรม
- ทำการทดสอบ Anderson-Darling เพื่อตรวจสอบความเป็นปกติของค่าความคลาดเคลื่อน
- หาและแสดงผล
significance_levelที่จะปฏิเสธสมมติฐานว่าง
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])