Zacznij terazZacznij za darmo

Rozkład błędów

Niemal żadnego rzeczywistego procesu nie da się przewidzieć idealnie. Pożądanym wynikiem jest sytuacja, w której błąd ma rozkład normalny. Oznacza to, że niektóre rzeczywiste wartości będą wyższe od prognozowanych, a inne – niższe. Innymi słowy, błędy (czyli różnice między wartościami rzeczywistymi a przewidywanymi) będą „unosić się" losowo wokół zera.

W tym ćwiczeniu przeanalizujesz wyniki gotowego modelu liniowego, który przewiduje wynagrodzenie funkcjonariusza policji. Następnie przyjrzysz się błędom i sprawdzisz, czy mają w przybliżeniu rozkład normalny. Predykcje są przechowywane jako lista wartości w preds, a rzeczywiste wynagrodzenia – w salaries.

To ćwiczenie jest częścią kursu

Podstawy wnioskowania statystycznego w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Oblicz błąd jako rzeczywiste wynagrodzenia minus przewidywane wynagrodzenia.
  • Przedstaw błędy na histogramie.
  • Przeprowadź test Andersona-Darlinga na normalność rozkładu błędów.
  • Znajdź i wyświetl poziomy istotności significance_level, przy których hipoteza zerowa zostałaby odrzucona.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Compute the error as actual minus predicted salary
error = ____

# Plot the errors as a histogram
plt.____(____)
plt.show()

# Conduct an Anderson-Darling test using the years of experience
result = ____(____)

# Find where the result is significant
print(result.____[result.____ > result.____])
Edytuj i uruchom kod