Začněte nyníZačněte zdarma

Testování normality

Celá řada výkonných statistických nástrojů – včetně mnoha běžných testů hypotéz – stojí na předpokladu, že podkladová data mají normální rozdělení. Histogram může naznačit, zda jsou data přibližně normálně rozdělena, ale přímo tuto hypotézu ověřit umožňují teprve příslušné statistické testy. Navíc histogramy bývají velmi citlivé na počet sloupků (binů), zejména při malých velikostech vzorků.

V tomto cvičení budeš pracovat s daty o platech zaměstnanců města Austin v salary_df. Zaměříš se konkrétně na hispánské hasiče a pomocí Andersonova-Darlingova testu zjistíš, zda jsou jejich odpracované roky přibližně normálně rozděleny.

Toto cvičení je součástí kurzu

Základy statistické inference v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vykresli histogram zobrazující Years of Employment pro dané zaměstnance.
  • Proveď Andersonův-Darlingův test normality a zjisti, zda je Years of Employment přibližně normálně rozděleno.
  • Zjisti, které critical_values jsou menší než testová statistika statistic.
  • Vypiš significance_level(s), na kterých by byla nulová hypotéza zamítnuta.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()

# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)

# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)

# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])
Upravit a spustit kód