Vérifier la normalité
Une puissante panoplie d'outils statistiques, qui comprend plusieurs tests d'hypothèses courants, repose sur l'hypothèse que les données sous-jacentes suivent une loi normale. Même si un histogramme peut suggérer si les données sont à peu près normales, divers tests d'hypothèses permettent de vérifier directement cette hypothèse. De plus, les histogrammes sont très sensibles au nombre de classes, surtout quand l'échantillon est petit.
Dans cet exercice, vous travaillerez avec les données salariales des employé·e·s de la Ville d'Austin dans salary_df. Plus précisément, vous vous intéresserez aux pompiers hispaniques. Vous analyserez si leurs années d'emploi suivent à peu près une distribution normale à l'aide du test d'Anderson-Darling.
Cette activité fait partie du cours
Fondements de l'inférence en Python
Instructions de l’exercice
- Tracez un histogramme des
Years of Employmentdes employé·e·s. - Effectuez un test de normalité d'Anderson-Darling pour vérifier si
Years of Employmentest approximativement distribué normalement. - Trouvez pour quelles
critical_valueslastatisticdu test est supérieure. - Affichez le ou les
significance_levelpour lesquels l'hypothèse nulle serait rejetée.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()
# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)
# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)
# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])