Bootstrap a standardní chyba
Představ si národní park, kde rangeři každý den chodí po stezkách jako součást jejich údržby. Ne vždy jdou stejnou trasou, ale vždy si zaznamenají celkovou vzdálenost a čas. Chceme sestavit statistický model variací denně uražené vzdálenosti z omezeného vzorku dat jednoho rangera.
Tvým cílem je využít bootstrapové převzorkování – spočítat jeden průměr pro každý převzorek – a vytvořit tak rozdělení průměrů. Poté vypočítáš standardní chybu jako způsob, jak kvantifikovat „nejistotu" ve výběrové statistice jako odhadu populační statistiky.
Použij předem načtené pole sample_data s 500 nezávislými měřeními uražené vzdálenosti. Zatím pracujeme se simulovanými daty, aby byla tato lekce přehledná. Realistická data uvidíš později.

Toto cvičení je součástí kurzu
Úvod do lineárního modelování v Pythonu
Pokyny k cvičení
Přiřaď
sample_datajako model populace.Opakuj
num_resampleskrát:- Pokaždé použij
np.random.choice()k vytvořeníbootstrap_sampleo velikostisize=resample_sizeodebraného zpopulation_modela nastavreplace=True. - Pokaždé vypočítej a ulož výběrový průměr.
- Pokaždé použij
Vypočítej a vypiš
np.mean()anp.std()zbootstrap_means.Pomocí předem definované funkce
plot_data_hist()vizualizuj rozděleníbootstrap_means.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Use the sample_data as a model for the population
population_model = ____
# Resample the population_model 100 times, computing the mean each sample
for nr in range(num_resamples):
bootstrap_sample = np.random.____(population_model, size=____, replace=____)
bootstrap_means[nr] = np.____(bootstrap_sample)
# Compute and print the mean, stdev of the resample distribution of means
distribution_mean = np.mean(____)
standard_error = np.std(____)
print('Bootstrap Distribution: center={:0.1f}, spread={:0.1f}'.format(____, ____))
# Plot the bootstrap resample distribution of means
fig = plot_data_hist(____)