Бутстреп і стандартна похибка
Уявіть Національний парк, де рейнджери щодня ходять пішки, підтримуючи стежки. Вони не завжди йдуть одним і тим самим маршрутом, але записують пройдену відстань і час. Ми хочемо побудувати статистичну модель варіацій щоденної пройденої відстані на основі обмеженої вибірки даних від одного рейнджера.
Ваше завдання — використати бутстреп-перезразкування і, обчислюючи одне середнє для кожної перезразки, створити розподіл середніх, а потім обчислити стандартну похибку як спосіб кількісно оцінити «невизначеність» вибіркової статистики як оцінювача популяційної статистики.
Скористайтеся попередньо завантаженим масивом sample_data з 500 незалежними вимірюваннями пройденої відстані. Поки що ми використовуємо змодельований набір даних, щоб спростити цей урок. Згодом розглянемо реалістичніші дані.

Ця вправа є частиною курсу
Вступ до лінійного моделювання в Python
Інструкції до вправи
Призначте
sample_dataяк модель для генеральної сукупності.Повторіть
num_resamplesразів:- Кожного разу використовуйте
np.random.choice()для створенняbootstrap_sampleрозміруsize=resample_size, взятої зpopulation_model, і вкажітьreplace=True. - Щоразу обчислюйте та зберігайте вибіркове середнє.
- Кожного разу використовуйте
Обчисліть і виведіть
np.mean()таnp.std()дляbootstrap_means.Скористайтеся заздалегідь визначеною функцією
plot_data_hist()і візуалізуйте розподілbootstrap_means.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Use the sample_data as a model for the population
population_model = ____
# Resample the population_model 100 times, computing the mean each sample
for nr in range(num_resamples):
bootstrap_sample = np.random.____(population_model, size=____, replace=____)
bootstrap_means[nr] = np.____(bootstrap_sample)
# Compute and print the mean, stdev of the resample distribution of means
distribution_mean = np.mean(____)
standard_error = np.std(____)
print('Bootstrap Distribution: center={:0.1f}, spread={:0.1f}'.format(____, ____))
# Plot the bootstrap resample distribution of means
fig = plot_data_hist(____)