Les résultats du Belmont Stakes suivent-ils une loi normale?
Depuis 1926, le Belmont Stakes est une course de 1,5 mille pour des chevaux pur-sang âgés de 3 ans. Secretariat a réalisé en 1973 le Belmont Stakes le plus rapide de l'histoire. Même si cette année-là a été la plus rapide, 1970 a été la plus lente en raison de conditions exceptionnellement mouillées et boueuses. En retirant ces deux valeurs aberrantes de l'ensemble de données, calculez la moyenne et l'écart type des temps des vainqueurs du Belmont. Échantillonnez selon une loi normale avec cette moyenne et cet écart type à l'aide de la fonction rng.normal() et tracez une FDR. Superposez la FDEA obtenue à partir des temps gagnants du Belmont. Ces résultats sont-ils proches d'une distribution normale?
Remarque : Justin a récupéré les données sur le Belmont Stakes à partir de la page Wikipédia du Belmont.
Cette activité fait partie du cours
Réflexion statistique en Python (Partie 1)
Instructions de l’exercice
- Calculez la moyenne et l'écart type des temps des vainqueurs du Belmont en retirant les deux valeurs aberrantes. Le tableau NumPy
belmont_no_outlierscontient ces données. - Prélevez 10 000 échantillons d'une loi normale ayant cette moyenne et cet écart type à l'aide de
rng.normal(). - Calculez la FDR des échantillons théoriques et la FDEA des données des vainqueurs du Belmont, et assignez les résultats à
x_theor, y_theoretx, y, respectivement. - Cliquez sur "Soumettre la réponse" pour tracer la FDR de vos échantillons avec la FDEA, ajoutez des étiquettes à vos axes et affichez le graphique.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Compute mean and standard deviation: mu, sigma
# Sample out of a normal distribution with this mu and sigma: samples
# Get the CDF of the samples and of the data
# Plot the CDFs and show the plot
_ = plt.plot(x_theor, y_theor)
_ = plt.plot(x, y, marker='.', linestyle='none')
_ = plt.xlabel('Belmont winning time (sec.)')
_ = plt.ylabel('CDF')
plt.show()