このパラメータはなぜ最適なのか?
最適な \(\tau\) の 2 倍をパラメータにした指数分布からサンプルを取りましょう。続けて、最適な \(\tau\) の 1/2 をパラメータにした場合でも行います。これらのサンプルから CDF を作成し、元のデータに重ねて表示してください。データの再現性が劣ることがわかるはずです。つまり、無ノーヒッター間隔の平均から計算した \(\tau\) は、データを最もよく再現するという意味で最適です。
注意: この演習および以降のすべての演習では、乱数生成器はあらかじめシード設定されています。タイプ量を減らせるようにしてあります。
この演習はコースの一部です
Pythonで学ぶ統計思考(パート2)
演習の手順
- パラメータ \(\tau_{1/2}\) =
tau/2の指数分布から10000個のサンプルを取りましょう。 - パラメータ \(\tau_{2}\) =
2*tauの指数分布から10000個のサンプルを取りましょう。 - これら2組のサンプルから、作成した
ecdf()関数で CDF を生成します。 - 2つの CDF を線としてプロットに追加します。これはすでに用意してあるので、"Submit Answer" を押してプロットを確認しましょう!
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Plot the theoretical CDFs
plt.plot(x_theor, y_theor)
plt.plot(x, y, marker='.', linestyle='none')
plt.margins(0.02)
plt.xlabel('Games between no-hitters')
plt.ylabel('CDF')
# Take samples with half tau: samples_half
samples_half = ____
# Take samples with double tau: samples_double
samples_double = ____
# Generate CDFs from these samples
x_half, y_half = ____
x_double, y_double = ____
# Plot these CDFs as lines
_ = plt.plot(x_half, y_half)
_ = plt.plot(x_double, y_double)
# Show the plot
plt.show()