เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การกระจายของค่าความคลาดเคลื่อน

แทบไม่มีกระบวนการใดในโลกจริงที่สามารถพยากรณ์ได้อย่างสมบูรณ์แบบ ผลลัพธ์ที่พึงประสงค์คือค่าความคลาดเคลื่อนควรมีการกระจายแบบปกติ (normal distribution) ซึ่งหมายความว่าบางค่าจริงจะสูงกว่าค่าพยากรณ์ และบางค่าจะต่ำกว่า กล่าวคือ ค่าความคลาดเคลื่อน (ผลต่างระหว่างค่าจริงกับค่าพยากรณ์) จะกระจายตัวแบบสุ่มรอบศูนย์

ในแบบฝึกหัดนี้ จะได้วิเคราะห์ผลลัพธ์จากโมเดลเชิงเส้นที่สร้างไว้ล่วงหน้า ซึ่งใช้พยากรณ์เงินเดือนของเจ้าหน้าที่ตำรวจ จากนั้นตรวจสอบว่าค่าความคลาดเคลื่อนมีการกระจายแบบปกติโดยประมาณหรือไม่ โดยค่าพยากรณ์จะอยู่ในลิสต์ preds และเงินเดือนจริงจะอยู่ในลิสต์ salaries

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

พื้นฐานการอนุมานทางสถิติด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • คำนวณค่าความคลาดเคลื่อนโดยนำเงินเดือนจริงลบด้วยเงินเดือนที่พยากรณ์ได้
  • แสดงค่าความคลาดเคลื่อนในรูปแบบฮิสโตแกรม
  • ทำการทดสอบ Anderson-Darling เพื่อตรวจสอบความเป็นปกติของค่าความคลาดเคลื่อน
  • หาและแสดงผล significance_level ที่จะปฏิเสธสมมติฐานว่าง

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Compute the error as actual minus predicted salary
error = ____

# Plot the errors as a histogram
plt.____(____)
plt.show()

# Conduct an Anderson-Darling test using the years of experience
result = ____(____)

# Find where the result is significant
print(result.____[result.____ > result.____])
แก้ไขและรันโค้ด