Testování normality
Celá řada výkonných statistických nástrojů – včetně mnoha běžných testů hypotéz – stojí na předpokladu, že podkladová data mají normální rozdělení. Histogram může naznačit, zda jsou data přibližně normálně rozdělena, ale přímo tuto hypotézu ověřit umožňují teprve příslušné statistické testy. Navíc histogramy bývají velmi citlivé na počet sloupků (binů), zejména při malých velikostech vzorků.
V tomto cvičení budeš pracovat s daty o platech zaměstnanců města Austin v salary_df. Zaměříš se konkrétně na hispánské hasiče a pomocí Andersonova-Darlingova testu zjistíš, zda jsou jejich odpracované roky přibližně normálně rozděleny.
Toto cvičení je součástí kurzu
Základy statistické inference v Pythonu
Pokyny k cvičení
- Vykresli histogram zobrazující
Years of Employmentpro dané zaměstnance. - Proveď Andersonův-Darlingův test normality a zjisti, zda je
Years of Employmentpřibližně normálně rozděleno. - Zjisti, které
critical_valuesjsou menší než testová statistikastatistic. - Vypiš
significance_level(s), na kterých by byla nulová hypotéza zamítnuta.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()
# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)
# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)
# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])