Testarea normalității
O serie de instrumente statistice puternice, printre care se numără câteva teste de ipoteză comune, se bazează pe presupunerea că datele subiacente urmează o distribuție normală. Deși o histogramă poate sugera dacă datele sunt aproximativ normal distribuite, diverse teste de ipoteză ne permit să verificăm această presupunere în mod direct. În plus, histogramele pot fi foarte sensibile la numărul de intervale (bins), mai ales când dimensiunile eșantioanelor sunt mici.
În acest exercițiu vei lucra cu date salariale ale angajaților orașului Austin, stocate în salary_df. Vei analiza în special pompierii de origine hispanică și vei verifica dacă anii lor de activitate urmează aproximativ o distribuție normală, folosind testul de ipoteză Anderson-Darling.
Acest exercițiu face parte din cursul
Bazele inferenței în Python
Instrucțiuni pentru exercițiu
- Trasează o histogramă care să afișeze
Years of Employmentpentru angajați. - Efectuează un test Anderson-Darling pentru normalitate, pentru a verifica dacă
Years of Employmenturmează aproximativ o distribuție normală. - Identifică valorile din
critical_valuesfață de care statistica testului (statistic) este mai mare. - Afișează nivelul (nivelurile) de semnificație (
significance_level) la care ipoteza nulă ar fi respinsă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()
# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)
# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)
# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])