ПочатиПочніть безкоштовно

Розподіл похибок

Майже жоден реальний процес не можна передбачити ідеально. Бажано, щоб похибка мала нормальний розподіл. Це означає, що деякі фактичні значення будуть вищими за вашу прогнозну оцінку, а деякі — нижчими. Тобто похибки (різниця між фактичними значеннями та прогнозами) ніби «плавають» навколо нуля випадковим чином.

У цій вправі ви проаналізуєте результати заздалегідь побудованої лінійної моделі, яка прогнозує зарплату поліцейського. Далі ви розглянете похибку та перевірите, чи вона приблизно має нормальний розподіл. Прогнози — це список значень у змінній preds, а фактичні зарплати — список значень у змінній salaries.

Ця вправа є частиною курсу

Основи інференції в Python

Переглянути курс

Інструкції до вправи

  • Обчисліть похибку як фактичні зарплати мінус прогнозовані зарплати.
  • Побудуйте гістограму похибок.
  • Виконайте тест Андерсона—Дарлінга на нормальність для похибок.
  • Знайдіть і виведіть significance_level(s), за яких нульова гіпотеза відхиляється.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Compute the error as actual minus predicted salary
error = ____

# Plot the errors as a histogram
plt.____(____)
plt.show()

# Conduct an Anderson-Darling test using the years of experience
result = ____(____)

# Find where the result is significant
print(result.____[result.____ > result.____])
Редагувати та запускати код