Распределение ошибок
Практически ни один реальный процесс нельзя предсказать идеально. Желаемый результат — ошибки предсказания имеют нормальное распределение. Это означает, что часть фактических значений окажется выше предсказанных, часть — ниже, а сами ошибки (то есть разность между фактическими значениями и предсказаниями) будут случайным образом «плавать» вокруг нуля.
В этом упражнении вы проанализируете результаты заранее построенной линейной модели, которая предсказывает зарплату полицейского. Затем вы исследуете ошибки и проверите, близко ли их распределение к нормальному. Предсказания хранятся в виде списка значений в переменной preds, а фактические зарплаты — в переменной salaries.
Это упражнение является частью курса
Основы статистического вывода на Python
Инструкции к упражнению
- Вычислите ошибку как разность между фактическими зарплатами и предсказанными.
- Постройте гистограмму ошибок.
- Проведите тест Андерсона–Дарлинга на нормальность для ошибок.
- Найдите и выведите
significance_level(s), при которых нулевая гипотеза будет отвергнута.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])