Testa för normalitet
Många statistiska verktyg – däribland flera vanliga hypotestester – förutsätter att underliggande data är normalfördelad. Ett histogram kan ge en indikation på om data är ungefär normalfördelad, men hypotestester låter oss pröva detta antagande direkt. Dessutom är histogram känsliga för antalet intervall, särskilt när urvalsstorlekarna är små.
I den här övningen arbetar du med lönedata från anställda i staden Austin, lagrad i salary_df. Du fokuserar på hispaniska brandmän och analyserar om deras antal anställningsår är ungefär normalfördelade med hjälp av Anderson-Darling-testet.
Den här övningen är en del av kursen
Grunderna i inferens med Python
Övningsinstruktioner
- Rita ett histogram som visar
Years of Employmentför de anställda. - Utför ett Anderson-Darling-test för normalitet för att undersöka om
Years of Employmentär ungefär normalfördelad. - Ta reda på vilka
critical_valuessom testetsstatisticär större än. - Skriv ut den eller de
significance_levelvid vilka nollhypotesen skulle förkastas.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()
# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)
# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)
# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])