Proč je tento parametr optimální?
Teď vyber vzorky z exponenciálního rozdělení, kde \(\tau\) je dvakrát větší než optimální \(\tau\). Totéž proveď pro \(\tau\) poloviční. Z těchto vzorků vytvoř CDF a překryj je se svými daty. Uvidíš, že ta data reprodukují hůře. Hodnota \(\tau\) vypočítaná z průměrných časů mezi no-hittery je tedy optimální v tom smyslu, že nejlépe odpovídá skutečným datům.
Poznámka: V tomto i všech následujících cvičeních je generátor náhodných čísel předem inicializovaný, abys nemusel/a zbytečně opisovat kód.
Toto cvičení je součástí kurzu
Statistical Thinking in Python (Part 2)
Pokyny k cvičení
- Vyber
10000vzorků z exponenciálního rozdělení s parametrem \(\tau_{1/2}\) =tau/2. - Vyber
10000vzorků z exponenciálního rozdělení s parametrem \(\tau_{2}\) =2*tau. - Z obou sad vzorků vytvoř CDF pomocí své funkce
ecdf(). - Přidej tyto dvě CDF jako křivky do grafu. Tento krok je za tebe již připravený – stačí kliknout na tlačítko pro odeslání a zobrazit graf!
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Plot the theoretical CDFs
plt.plot(x_theor, y_theor)
plt.plot(x, y, marker='.', linestyle='none')
plt.margins(0.02)
plt.xlabel('Games between no-hitters')
plt.ylabel('CDF')
# Take samples with half tau: samples_half
samples_half = ____
# Take samples with double tau: samples_double
samples_double = ____
# Generate CDFs from these samples
x_half, y_half = ____
x_double, y_double = ____
# Plot these CDFs as lines
_ = plt.plot(x_half, y_half)
_ = plt.plot(x_double, y_double)
# Show the plot
plt.show()