Dlaczego ten parametr jest optymalny?
Teraz pobierz próbki z rozkładu wykładniczego, gdzie \(\tau\) jest dwa razy większe od optymalnego \(\tau\). Powtórz to samo dla \(\tau\) dwa razy mniejszego. Wyznacz dystrybuanty empiryczne tych próbek i nałóż je na wykres z danymi. Zobaczysz, że nie odwzorowują danych tak dobrze. To pokazuje, że \(\tau\) obliczone ze średnich czasów między no-hitterami jest optymalne – najlepiej odtwarza ono strukturę danych.
Uwaga: W tym i wszystkich kolejnych ćwiczeniach generator liczb losowych jest z góry ustawiony na stały ziarno, żebyś nie musiał go za każdym razem wpisywać.
To ćwiczenie jest częścią kursu
Myślenie statystyczne w Pythonie (część 2)
Instrukcje do ćwiczenia
- Pobierz
10000próbek z rozkładu wykładniczego z parametrem \(\tau_{1/2}\) =tau/2. - Pobierz
10000próbek z rozkładu wykładniczego z parametrem \(\tau_{2}\) =2*tau. - Wyznacz dystrybuanty empiryczne obu zestawów próbek, korzystając z funkcji
ecdf(). - Dodaj te dwie dystrybuanty jako linie do wykresu. Ten krok jest już wykonany – kliknij Prześlij odpowiedź, aby zobaczyć wykres!
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Plot the theoretical CDFs
plt.plot(x_theor, y_theor)
plt.plot(x, y, marker='.', linestyle='none')
plt.margins(0.02)
plt.xlabel('Games between no-hitters')
plt.ylabel('CDF')
# Take samples with half tau: samples_half
samples_half = ____
# Take samples with double tau: samples_double
samples_double = ____
# Generate CDFs from these samples
x_half, y_half = ____
x_double, y_double = ____
# Plot these CDFs as lines
_ = plt.plot(x_half, y_half)
_ = plt.plot(x_double, y_double)
# Show the plot
plt.show()