Odpovídají výsledky Belmont Stakes normálnímu rozdělení?
Belmont Stakes se koná od roku 1926 a jde o závod plnokrevných tříletých koní na vzdálenost 1,5 míle. Secretariat zaběhl v roce 1973 nejrychlejší Belmont Stakes v historii. Naopak rok 1970 byl nejpomalejší kvůli neobvykle mokrému a kluzkému povrchu dráhy. Po odstranění těchto dvou odlehlých hodnot z datové sady vypočítej průměr a směrodatnou odchylku časů vítězů Belmont Stakes. Pomocí funkce rng.normal() vyber vzorky z normálního rozdělení s tímto průměrem a směrodatnou odchylkou a vykresli CDF. Přes ni zobraz ECDF skutečných vítězných časů. Blíží se tato data normálnímu rozdělení?
Poznámka: Justin získal data o Belmont Stakes ze stránky Belmont Stakes na Wikipedii.
Toto cvičení je součástí kurzu
Statistical Thinking in Python (Part 1)
Pokyny k cvičení
- Vypočítej průměr a směrodatnou odchylku časů vítězů Belmont Stakes po odstranění dvou odlehlých hodnot. Tato data jsou uložena v poli NumPy
belmont_no_outliers. - Pomocí
rng.normal()získej 10 000 vzorků z normálního rozdělení s tímto průměrem a směrodatnou odchylkou. - Vypočítej CDF teoretických vzorků a ECDF dat vítězů Belmont Stakes a výsledky přiřaď do
x_theor, y_theor, resp.x, y. - Klikni na Submit a zobraz graf CDF svých vzorků spolu s ECDF, popisky os a výsledný plot.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Compute mean and standard deviation: mu, sigma
# Sample out of a normal distribution with this mu and sigma: samples
# Get the CDF of the samples and of the data
# Plot the CDFs and show the plot
_ = plt.plot(x_theor, y_theor)
_ = plt.plot(x, y, marker='.', linestyle='none')
_ = plt.xlabel('Belmont winning time (sec.)')
_ = plt.ylabel('CDF')
plt.show()