Rezultatele de la Belmont Stakes urmează o distribuție normală?
Din 1926, Belmont Stakes este o cursă de 1,5 mile pentru cai pursânge de 3 ani. Secretariat a câștigat cea mai rapidă ediție din istorie, în 1973. Deși acel an a fost cel mai rapid, 1970 a fost cel mai lent, din cauza condițiilor neobișnuit de ude și alunecoase. Cu acești doi outlieri eliminați din setul de date, calculează media și abaterea standard ale timpilor câștigătorilor de la Belmont. Extrage eșantioane dintr-o distribuție normală cu această medie și această abatere standard, folosind funcția rng.normal(), și trasează un CDF. Suprapune ECDF-ul calculat pe baza timpilor câștigători. Datele sunt apropiate de o distribuție normală?
Notă: Justin a extras datele despre Belmont Stakes de pe pagina Wikipedia dedicată Belmont Stakes.
Acest exercițiu face parte din cursul
Gândire statistică în Python (Partea 1)
Instrucțiuni pentru exercițiu
- Calculează media și abaterea standard ale timpilor câștigătorilor de la Belmont, cu cei doi outlieri eliminați. Vectorul NumPy
belmont_no_outliersconține aceste date. - Extrage 10.000 de eșantioane dintr-o distribuție normală cu această medie și această abatere standard, folosind
rng.normal(). - Calculează CDF-ul eșantioanelor teoretice și ECDF-ul datelor câștigătorilor de la Belmont, atribuind rezultatele variabilelor
x_theor, y_theor, respectivx, y. - Apasă Trimite răspunsul pentru a reprezenta grafic CDF-ul eșantioanelor tale alături de ECDF, etichetează axele și afișează graficul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Compute mean and standard deviation: mu, sigma
# Sample out of a normal distribution with this mu and sigma: samples
# Get the CDF of the samples and of the data
# Plot the CDFs and show the plot
_ = plt.plot(x_theor, y_theor)
_ = plt.plot(x, y, marker='.', linestyle='none')
_ = plt.xlabel('Belmont winning time (sec.)')
_ = plt.ylabel('CDF')
plt.show()