誤差の分布
現実のプロセスを完全に予測できることはほとんどありません。望ましいのは、誤差が正規分布に従うことです。つまり、実際の値が予測より大きい場合もあれば小さい場合もあり、誤差(実際の値と予測の差)はゼロの周りにランダムに「浮いている」ように見えます。
この演習では、警察官の給与を予測するあらかじめ作成された線形モデルの結果を分析します。次に、誤差を確認し、それがおおむね正規分布に従っているかを調べます。予測値はpredsというリストに、実際の給与はsalariesというリストに格納されています。
この演習はコースの一部です
Pythonで学ぶ推測の基礎
演習の手順
- 誤差を「実際の給与 − 予測された給与」として計算します。
- 誤差をヒストグラムで可視化します。
- 誤差に対してAnderson–Darlingの正規性検定を実行します。
- 帰無仮説が棄却される
significance_level(有意水準)を特定して表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Compute the error as actual minus predicted salary
error = ____
# Plot the errors as a histogram
plt.____(____)
plt.show()
# Conduct an Anderson-Darling test using the years of experience
result = ____(____)
# Find where the result is significant
print(result.____[result.____ > result.____])