Соответствуют ли данные нашей модели?
Вы смоделировали матчи без хитов с помощью показательного распределения. Постройте ECDF на основе реальных данных и наложите на него теоретическую CDF. Это позволит убедиться, что показательное распределение хорошо описывает наблюдаемые данные.
Возможно, вам будет полезно вспомнить функцию, созданную в предыдущем курсе для вычисления ECDF, а также код для её визуализации.
Это упражнение является частью курса
Статистическое мышление на Python (часть 2)
Инструкции к упражнению
- Вычислите ECDF по реальным данным о времени между матчами без хитов (
nohitter_times). Используйте функциюecdf(), написанную в предыдущем курсе. - Постройте CDF по теоретическим выборкам из прошлого упражнения (
inter_nohitter_time). - Отобразите
x_theorиy_theorв виде линии с помощьюplt.plot(). Затем наложите ECDF реальных данныхxиyв виде точек — для этого дополнительно укажите именованные аргументыmarker = '.'иlinestyle = 'none'внутриplt.plot(). - Задайте отступ 2% по краям графика.
- Отобразите график.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create an ECDF from real data: x, y
x, y = ____
# Create a CDF from theoretical samples: x_theor, y_theor
x_theor, y_theor = ____
# Overlay the plots
plt.plot(____, ____)
plt.plot(____, ____, marker=____, linestyle=____)
# Margins and axis labels
plt.margins(____)
plt.xlabel('Games between no-hitters')
plt.ylabel('CDF')
# Show the plot
plt.show()