正規性の検定
多くの一般的な仮説検定を含む強力な統計ツール群は、基礎となるデータが正規分布に従うという仮定に依存しています。ヒストグラムはデータがおおよそ正規分布かどうかの手がかりになりますが、さまざまな仮説検定を使うとこの仮定を直接検証できます。さらに、ヒストグラムはビン数の影響を受けやすく、特にサンプルサイズが小さい場合は注意が必要です。
この演習では、オースティン市の職員の給与データ salary_df を扱います。特にヒスパニック系の消防士に注目し、在職年数が正規分布に近いかどうかを、Anderson–Darling 検定で分析します。
この演習はコースの一部です
Pythonで学ぶ推測の基礎
演習の手順
- 職員の
Years of Employmentのヒストグラムを描画します。 Years of Employmentがおおよそ正規分布かどうかを調べるため、正規性に対する Anderson–Darling 検定を実行します。- 検定の
statisticがどのcritical_valuesを上回るかを特定します。 - 帰無仮説が棄却される
significance_levelを出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Plot a histogram of the employees' "Years of Employment"
____.plot(kind="____")
plt.show()
# Conduct an Anderson-Darling test using the years of employment from salary_df
result = stats.____(____)
# Print which critical values the test statistic is greater than the critical values
print(result.____ > result.____)
# Print the significance levels at which the null hypothesis is rejected
print(result.____[result.____ > result.____])