त्रुटियों का वितरण
लगभग कोई भी वास्तविक-जीवन प्रक्रिया पूरी तरह सटीक भविष्यवाणी नहीं की जा सकती. आदर्श स्थिति यह है कि त्रुटि सामान्य (normally) वितरित हो. इसका मतलब है कि कुछ वास्तविक मान आपकी prediction से ऊपर होंगे और कुछ उससे नीचे. यानी, त्रुटियाँ (अर्थात् वास्तविक मान और predictions के बीच का अंतर) शून्य के आसपास यादृच्छिक रूप से "तैरती" हुई दिखेंगी.
इस अभ्यास में, आप एक पहले से बने linear model के परिणामों का विश्लेषण करेंगे जो किसी पुलिस अधिकारी की सैलरी predict करता है. फिर आप त्रुटि को देखेंगे कि क्या वह लगभग सामान्य रूप से वितरित है. predictions preds नामक सूची में संग्रहीत हैं, और वास्तविक सैलरीज़ salaries नामक सूची में संग्रहीत हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में अनुमान का आधार
अभ्यास निर्देश
- त्रुटि को वास्तविक सैलरी से predicted सैलरी घटाकर निकालें.
- त्रुटियों को एक histogram में प्लॉट करें.
- त्रुटियों के लिए normality का Anderson–Darling टेस्ट चलाएँ.
- वे
significance_level(s) ढूँढें और प्रिंट करें जिन पर शून्य परिकल्पना अस्वीकृत होगी.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])