Začněte nyníZačněte zdarma

Rozdělení chyb

Téměř žádný reálný proces nelze předpovědět dokonale. Ideální výsledek je, aby chyba měla normální rozdělení – to znamená, že některé skutečné hodnoty budou nad tvou predikcí a jiné pod ní. Jinými slovy, chyby (tedy rozdíl mezi skutečnými hodnotami a predikcemi) by měly „náhodně kolísat" kolem nuly.

V tomto cvičení analyzuješ výsledky předem sestaveného lineárního modelu, který předpovídá plat policisty. Podíváš se na chyby a zjistíš, zda mají přibližně normální rozdělení. Predikce jsou uloženy jako seznam hodnot v proměnné preds a skutečné platy jako seznam hodnot v proměnné salaries.

Toto cvičení je součástí kurzu

Základy statistické inference v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vypočítej chybu jako skutečné platy minus predikované platy.
  • Zobraz chyby v histogramu.
  • Proveď Anderson-Darlingův test normality pro chyby.
  • Najdi a vypiš significance_level(s), při kterých by byla nulová hypotéza zamítnuta.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Compute the error as actual minus predicted salary
error = ____

# Plot the errors as a histogram
plt.____(____)
plt.show()

# Conduct an Anderson-Darling test using the years of experience
result = ____(____)

# Find where the result is significant
print(result.____[result.____ > result.____])
Upravit a spustit kód