CommencezCommencez gratuitement

Distribution des erreurs

Presque aucun processus réel ne peut être prédit parfaitement. Un résultat souhaitable est que l'erreur suive une distribution normale. Cela signifie que certaines valeurs réelles seront au-dessus de votre prédiction et d'autres en dessous. Autrement dit, les erreurs (c.-à-d. la différence entre les valeurs réelles et les prédictions) semblent « flotter » au hasard autour de zéro.

Dans cet exercice, vous analyserez les résultats d'un modèle linéaire préétabli qui prédit le salaire d'un policier. Vous examinerez ensuite l'erreur pour vérifier si elle est approximativement distribuée normalement. Les prédictions sont une liste de valeurs stockées dans preds, et les salaires réels sont une liste de valeurs stockées dans salaries.

Cette activité fait partie du cours

Fondements de l'inférence en Python

Voir le cours

Instructions de l’exercice

  • Calculez l'erreur comme le salaire réel moins le salaire prédit.
  • Tracez les erreurs dans un histogramme.
  • Effectuez un test d'Anderson-Darling de normalité sur les erreurs.
  • Trouvez et affichez le ou les significance_level auxquels l'hypothèse nulle serait rejetée.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Compute the error as actual minus predicted salary
error = ____

# Plot the errors as a histogram
plt.____(____)
plt.show()

# Conduct an Anderson-Darling test using the years of experience
result = ____(____)

# Find where the result is significant
print(result.____[result.____ > result.____])
Modifier et exécuter le code