ldl 変数の分布当てはまり評価
この演習では、糖尿病データセット dia の 1 つの変数、血清 ldl に注目します。Kolmogorov–Smirnov 検定から得られる追加情報に基づいて、ldl に対して正規分布が依然として良い選択かどうかを判断します。
dia DataFrame は読み込まれています。さらに、pandas は pd、numpy は np、scipy.stats は st としてインポート済みです。
この演習はコースの一部です
Pythonで学ぶモンテカルロ・シミュレーション
演習の手順
- 候補分布を含む
list_of_distsを定義します。順番はラプラス、正規、指数(それぞれscipy.statsの正しい名前を使用)。 - ループ内で、対応する確率分布でデータをフィットし、結果を
paramに保存します。 - Kolmogorov–Smirnov 検定で適合度を評価し、結果を
resultに保存します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# List candidate distributions to evaluate
list_of_dists = [____]
for i in list_of_dists:
dist = getattr(st, i)
# Fit the data to the probability distribution
param = dist.____
# Perform the ks test to evaluate goodness-of-fit
result = ____
print(result)