Kom igångKom igång gratis

Testa för normalitet

Många statistiska verktyg – däribland flera vanliga hypotestester – förutsätter att underliggande data är normalfördelad. Ett histogram kan ge en indikation på om data är ungefär normalfördelad, men hypotestester låter oss pröva detta antagande direkt. Dessutom är histogram känsliga för antalet intervall, särskilt när urvalsstorlekarna är små.

I den här övningen arbetar du med lönedata från anställda i staden Austin, lagrad i salary_df. Du fokuserar på hispaniska brandmän och analyserar om deras antal anställningsår är ungefär normalfördelade med hjälp av Anderson-Darling-testet.

Den här övningen är en del av kursen

Grunderna i inferens med Python

Visa kurs

Övningsinstruktioner

  • Rita ett histogram som visar Years of Employment för de anställda.
  • Utför ett Anderson-Darling-test för normalitet för att undersöka om Years of Employment är ungefär normalfördelad.
  • Ta reda på vilka critical_values som testets statistic är större än.
  • Skriv ut den eller de significance_level vid vilka nollhypotesen skulle förkastas.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()

# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)

# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)

# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])
Redigera och kör kod