始める無料で始める

このパラメータはなぜ最適なのか?

最適な \(\tau\) の 2 倍をパラメータにした指数分布からサンプルを取りましょう。続けて、最適な \(\tau\) の 1/2 をパラメータにした場合でも行います。これらのサンプルから CDF を作成し、元のデータに重ねて表示してください。データの再現性が劣ることがわかるはずです。つまり、無ノーヒッター間隔の平均から計算した \(\tau\) は、データを最もよく再現するという意味で最適です。

注意: この演習および以降のすべての演習では、乱数生成器はあらかじめシード設定されています。タイプ量を減らせるようにしてあります。

この演習はコースの一部です

Pythonで学ぶ統計思考(パート2)

コースを見る

演習の手順

  • パラメータ \(\tau_{1/2}\) = tau/2 の指数分布から 10000 個のサンプルを取りましょう。
  • パラメータ \(\tau_{2}\) = 2*tau の指数分布から 10000 個のサンプルを取りましょう。
  • これら2組のサンプルから、作成した ecdf() 関数で CDF を生成します。
  • 2つの CDF を線としてプロットに追加します。これはすでに用意してあるので、"Submit Answer" を押してプロットを確認しましょう!

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Plot the theoretical CDFs
plt.plot(x_theor, y_theor)
plt.plot(x, y, marker='.', linestyle='none')
plt.margins(0.02)
plt.xlabel('Games between no-hitters')
plt.ylabel('CDF')

# Take samples with half tau: samples_half
samples_half = ____

# Take samples with double tau: samples_double
samples_double = ____

# Generate CDFs from these samples
x_half, y_half = ____
x_double, y_double = ____

# Plot these CDFs as lines
_ = plt.plot(x_half, y_half)
_ = plt.plot(x_double, y_double)

# Show the plot
plt.show()
コードを編集して実行