Rozdělení chyb
Téměř žádný reálný proces nelze předpovědět dokonale. Ideální výsledek je, aby chyba měla normální rozdělení – to znamená, že některé skutečné hodnoty budou nad tvou predikcí a jiné pod ní. Jinými slovy, chyby (tedy rozdíl mezi skutečnými hodnotami a predikcemi) by měly „náhodně kolísat" kolem nuly.
V tomto cvičení analyzuješ výsledky předem sestaveného lineárního modelu, který předpovídá plat policisty. Podíváš se na chyby a zjistíš, zda mají přibližně normální rozdělení. Predikce jsou uloženy jako seznam hodnot v proměnné preds a skutečné platy jako seznam hodnot v proměnné salaries.
Toto cvičení je součástí kurzu
Základy statistické inference v Pythonu
Pokyny k cvičení
- Vypočítej chybu jako skutečné platy minus predikované platy.
- Zobraz chyby v histogramu.
- Proveď Anderson-Darlingův test normality pro chyby.
- Najdi a vypiš
significance_level(s), při kterých by byla nulová hypotéza zamítnuta.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])