НачатьНачать бесплатно

Распределение ошибок

Практически ни один реальный процесс нельзя предсказать идеально. Желаемый результат — ошибки предсказания имеют нормальное распределение. Это означает, что часть фактических значений окажется выше предсказанных, часть — ниже, а сами ошибки (то есть разность между фактическими значениями и предсказаниями) будут случайным образом «плавать» вокруг нуля.

В этом упражнении вы проанализируете результаты заранее построенной линейной модели, которая предсказывает зарплату полицейского. Затем вы исследуете ошибки и проверите, близко ли их распределение к нормальному. Предсказания хранятся в виде списка значений в переменной preds, а фактические зарплаты — в переменной salaries.

Это упражнение является частью курса

Основы статистического вывода на Python

Посмотреть курс

Инструкции к упражнению

  • Вычислите ошибку как разность между фактическими зарплатами и предсказанными.
  • Постройте гистограмму ошибок.
  • Проведите тест Андерсона–Дарлинга на нормальность для ошибок.
  • Найдите и выведите significance_level(s), при которых нулевая гипотеза будет отвергнута.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Compute the error as actual minus predicted salary
error = ____

# Plot the errors as a histogram
plt.____(____)
plt.show()

# Conduct an Anderson-Darling test using the years of experience
result = ____(____)

# Find where the result is significant
print(result.____[result.____ > result.____])
Редактировать и запускать код