CommencezCommencez gratuitement

Vérifier la normalité

Une puissante panoplie d'outils statistiques, qui comprend plusieurs tests d'hypothèses courants, repose sur l'hypothèse que les données sous-jacentes suivent une loi normale. Même si un histogramme peut suggérer si les données sont à peu près normales, divers tests d'hypothèses permettent de vérifier directement cette hypothèse. De plus, les histogrammes sont très sensibles au nombre de classes, surtout quand l'échantillon est petit.

Dans cet exercice, vous travaillerez avec les données salariales des employé·e·s de la Ville d'Austin dans salary_df. Plus précisément, vous vous intéresserez aux pompiers hispaniques. Vous analyserez si leurs années d'emploi suivent à peu près une distribution normale à l'aide du test d'Anderson-Darling.

Cette activité fait partie du cours

Fondements de l'inférence en Python

Voir le cours

Instructions de l’exercice

  • Tracez un histogramme des Years of Employment des employé·e·s.
  • Effectuez un test de normalité d'Anderson-Darling pour vérifier si Years of Employment est approximativement distribué normalement.
  • Trouvez pour quelles critical_values la statistic du test est supérieure.
  • Affichez le ou les significance_level pour lesquels l'hypothèse nulle serait rejetée.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()

# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)

# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)

# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])
Modifier et exécuter le code