Rozkład błędów
Niemal żadnego rzeczywistego procesu nie da się przewidzieć idealnie. Pożądanym wynikiem jest sytuacja, w której błąd ma rozkład normalny. Oznacza to, że niektóre rzeczywiste wartości będą wyższe od prognozowanych, a inne – niższe. Innymi słowy, błędy (czyli różnice między wartościami rzeczywistymi a przewidywanymi) będą „unosić się" losowo wokół zera.
W tym ćwiczeniu przeanalizujesz wyniki gotowego modelu liniowego, który przewiduje wynagrodzenie funkcjonariusza policji. Następnie przyjrzysz się błędom i sprawdzisz, czy mają w przybliżeniu rozkład normalny. Predykcje są przechowywane jako lista wartości w preds, a rzeczywiste wynagrodzenia – w salaries.
To ćwiczenie jest częścią kursu
Podstawy wnioskowania statystycznego w Pythonie
Instrukcje do ćwiczenia
- Oblicz błąd jako rzeczywiste wynagrodzenia minus przewidywane wynagrodzenia.
- Przedstaw błędy na histogramie.
- Przeprowadź test Andersona-Darlinga na normalność rozkładu błędów.
- Znajdź i wyświetl poziomy istotności
significance_level, przy których hipoteza zerowa zostałaby odrzucona.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])