EmpezarEmpieza gratis

Distribución de los errores

Casi ningún proceso del mundo real se puede predecir a la perfección. Un resultado deseable es que el error siga una distribución normal. Esto significa que algunos valores reales estarán por encima de tu predicción y otros por debajo. Es decir, los errores (la diferencia entre los valores reales y las predicciones) parecerán “flotar” aleatoriamente alrededor de cero.

En este ejercicio, analizarás los resultados de un modelo lineal ya construido que predice el salario de agentes de policía. Luego examinarás el error para ver si sigue aproximadamente una distribución normal. Las predicciones son una lista de valores almacenada en preds, y los salarios reales son una lista de valores almacenada en salaries.

Este ejercicio forma parte del curso

Fundamentos de la inferencia en Python

Ver curso

Instrucciones del ejercicio

  • Calcula el error como los salarios reales menos los salarios predichos.
  • Representa los errores en un histograma.
  • Realiza una prueba de normalidad de Anderson-Darling para los errores.
  • Encuentra e imprime el/los significance_level en el/los que se rechazaría la hipótesis nula.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Compute the error as actual minus predicted salary
error = ____

# Plot the errors as a histogram
plt.____(____)
plt.show()

# Conduct an Anderson-Darling test using the years of experience
result = ____(____)

# Find where the result is significant
print(result.____[result.____ > result.____])
Editar y ejecutar código