Distribuția erorilor
Aproape niciun proces din lumea reală nu poate fi prezis perfect. Un rezultat dezirabil este ca eroarea să fie distribuită normal. Aceasta înseamnă că unele valori reale vor fi peste predicție, iar altele vor fi sub ea – cu alte cuvinte, erorile (adică diferența dintre valorile reale și predicții) par să "plutească" aleatoriu în jurul valorii zero.
În acest exercițiu, vei analiza rezultatele unui model liniar pre-construit care prezice salariul unui polițist. Vei examina eroarea și vei verifica dacă aceasta este aproximativ distribuită normal. Predicțiile sunt stocate într-o listă numită preds, iar salariile reale se află într-o listă numită salaries.
Acest exercițiu face parte din cursul
Bazele inferenței în Python
Instrucțiuni pentru exercițiu
- Calculează eroarea ca diferența dintre salariile reale și salariile prezise.
- Reprezintă erorile într-o histogramă.
- Efectuează un test Anderson-Darling de normalitate pentru erori.
- Găsește și afișează
significance_level(urile) la care ipoteza nulă ar fi respinsă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])