Distribution des erreurs
Presque aucun processus réel ne peut être prédit parfaitement. Un résultat souhaitable est que l'erreur suive une distribution normale. Cela signifie que certaines valeurs réelles seront au-dessus de votre prédiction et d'autres en dessous. Autrement dit, les erreurs (c.-à-d. la différence entre les valeurs réelles et les prédictions) semblent « flotter » au hasard autour de zéro.
Dans cet exercice, vous analyserez les résultats d'un modèle linéaire préétabli qui prédit le salaire d'un policier. Vous examinerez ensuite l'erreur pour vérifier si elle est approximativement distribuée normalement. Les prédictions sont une liste de valeurs stockées dans preds, et les salaires réels sont une liste de valeurs stockées dans salaries.
Cette activité fait partie du cours
Fondements de l'inférence en Python
Instructions de l’exercice
- Calculez l'erreur comme le salaire réel moins le salaire prédit.
- Tracez les erreurs dans un histogramme.
- Effectuez un test d'Anderson-Darling de normalité sur les erreurs.
- Trouvez et affichez le ou les
significance_levelauxquels l'hypothèse nulle serait rejetée.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])