Distribuição dos erros
Quase nenhum processo do mundo real pode ser previsto perfeitamente. Um resultado desejável é que o erro tenha distribuição normal. Isso significa que alguns valores reais ficarão acima da sua previsão e outros ficarão abaixo. Ou seja, os erros (a diferença entre os valores reais e as previsões) vão "flutuar" aleatoriamente em torno de zero.
Neste exercício, você vai analisar resultados de um modelo linear pré-construído que prevê o salário de um policial. Em seguida, vai observar o erro e verificar se ele é aproximadamente normal. As previsões são uma lista de valores em preds, e os salários reais são uma lista de valores em salaries.
Este exercicio faz parte do curso
Fundamentos de Inferência em Python
Instruções do exercicio
- Calcule o erro como os salários reais menos os salários previstos.
- Plote os erros em um histograma.
- Realize um teste de normalidade de Anderson-Darling para os erros.
- Encontre e imprima o(s)
significance_levelem que a hipótese nula seria rejeitada.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])