Comprobación de normalidad
Un potente conjunto de herramientas estadísticas, que incluye varias pruebas de hipótesis comunes, depende del supuesto de que los datos subyacentes siguen una distribución normal. Aunque un histograma puede sugerir si los datos se aproximan a una distribución normal, varias pruebas de hipótesis nos permiten comprobar directamente este supuesto. Además, los histogramas pueden ser muy sensibles al número de intervalos (bins), especialmente cuando el tamaño de la muestra es pequeño.
En este ejercicio trabajarás con datos salariales de empleados de la Ciudad de Austin en salary_df. En concreto, te centrarás en bomberos hispanos. Analizarás si sus años de empleo se distribuyen aproximadamente de forma normal utilizando la prueba de hipótesis de Anderson-Darling.
Este ejercicio forma parte del curso
Fundamentos de la inferencia en Python
Instrucciones del ejercicio
- Dibuja un histograma que muestre los
Years of Employmentde las personas empleadas. - Realiza una prueba de normalidad de Anderson-Darling para ver si
Years of Employmentse distribuye aproximadamente de forma normal. - Averigua para qué
critical_valueslastatisticde la prueba es mayor. - Imprime el/los
significance_levelen el/los que se rechazaría la hipótesis nula.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()
# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)
# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)
# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])