Розподіл похибок
Майже жоден реальний процес не можна передбачити ідеально. Бажано, щоб похибка мала нормальний розподіл. Це означає, що деякі фактичні значення будуть вищими за вашу прогнозну оцінку, а деякі — нижчими. Тобто похибки (різниця між фактичними значеннями та прогнозами) ніби «плавають» навколо нуля випадковим чином.
У цій вправі ви проаналізуєте результати заздалегідь побудованої лінійної моделі, яка прогнозує зарплату поліцейського. Далі ви розглянете похибку та перевірите, чи вона приблизно має нормальний розподіл. Прогнози — це список значень у змінній preds, а фактичні зарплати — список значень у змінній salaries.
Ця вправа є частиною курсу
Основи інференції в Python
Інструкції до вправи
- Обчисліть похибку як фактичні зарплати мінус прогнозовані зарплати.
- Побудуйте гістограму похибок.
- Виконайте тест Андерсона—Дарлінга на нормальність для похибок.
- Знайдіть і виведіть
significance_level(s), за яких нульова гіпотеза відхиляється.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])