ÎncepețiÎncepe gratuit

Testarea normalității

O serie de instrumente statistice puternice, printre care se numără câteva teste de ipoteză comune, se bazează pe presupunerea că datele subiacente urmează o distribuție normală. Deși o histogramă poate sugera dacă datele sunt aproximativ normal distribuite, diverse teste de ipoteză ne permit să verificăm această presupunere în mod direct. În plus, histogramele pot fi foarte sensibile la numărul de intervale (bins), mai ales când dimensiunile eșantioanelor sunt mici.

În acest exercițiu vei lucra cu date salariale ale angajaților orașului Austin, stocate în salary_df. Vei analiza în special pompierii de origine hispanică și vei verifica dacă anii lor de activitate urmează aproximativ o distribuție normală, folosind testul de ipoteză Anderson-Darling.

Acest exercițiu face parte din cursul

Bazele inferenței în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Trasează o histogramă care să afișeze Years of Employment pentru angajați.
  • Efectuează un test Anderson-Darling pentru normalitate, pentru a verifica dacă Years of Employment urmează aproximativ o distribuție normală.
  • Identifică valorile din critical_values față de care statistica testului (statistic) este mai mare.
  • Afișează nivelul (nivelurile) de semnificație (significance_level) la care ipoteza nulă ar fi respinsă.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()

# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)

# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)

# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])
Editează și rulează codul