Чи розподілені результати Belmont Stakes за нормальним законом?
Із 1926 року Belmont Stakes — це забіг на 1,5 милі для трирічних чистокровних коней. Secretariat у 1973 році показав найшвидший результат в історії Belmont Stakes. Хоча це був найшвидший рік, 1970-й став найповільнішим через надзвичайно вологі та багнисті умови. Вилучивши ці дві викидні точки з набору даних, обчисліть середнє та стандартне відхилення часу переможців Belmont. Згенеруйте вибірку з нормального розподілу з цими параметрами за допомогою функції rng.normal() і побудуйте CDF. Накладіть ECDF для часів переможців Belmont. Чи наближаються ці дані до нормального розподілу?
Примітка: Джастін зібрав дані про Belmont Stakes зі сторінки Вікіпедії про Belmont.
Ця вправа є частиною курсу
Статистичне мислення в Python (Частина 1)
Інструкції до вправи
- Обчисліть середнє та стандартне відхилення часу переможців Belmont після вилучення двох викидів. Ці дані містяться в масиві NumPy
belmont_no_outliers. - Візьміть 10 000 вибірок із нормального розподілу з цими параметрами за допомогою
rng.normal(). - Обчисліть CDF теоретичних вибірок і ECDF даних переможців Belmont, записавши результати у
x_theor, y_theorтаx, yвідповідно. - Натисніть Submit Answer, щоб побудувати CDF ваших вибірок разом із ECDF, підпишіть осі та відобразіть графік.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Compute mean and standard deviation: mu, sigma
# Sample out of a normal distribution with this mu and sigma: samples
# Get the CDF of the samples and of the data
# Plot the CDFs and show the plot
_ = plt.plot(x_theor, y_theor)
_ = plt.plot(x, y, marker='.', linestyle='none')
_ = plt.xlabel('Belmont winning time (sec.)')
_ = plt.ylabel('CDF')
plt.show()