Odhad rychlosti a intervalu spolehlivosti
Pokračujeme v práci s daty o túrách v národním parku. Všimni si, že některé vzdálenosti jsou záporné – to znamená, že turisté šli opačným směrem od výchozího bodu trasy. Data jsou trochu neuspořádaná, takže se zaměříme jen na celkový trend.
Cílem tohoto cvičení je využít bootstrap resampling k nalezení rozdělení hodnot rychlosti pro lineární model a z tohoto rozdělení pak vypočítat nejlepší odhad rychlosti a 90% interval spolehlivosti. Rychlost zde představuje parametr směrnice z modelu lineární regrese, který proložíme vzdáleností jako funkcí času.
Abys měl/a dobrý start, máš předem načtená data distance a time společně s předpřipravenou funkcí least_squares(), která vypočítá hodnotu rychlosti pro každý resample.

Toto cvičení je součástí kurzu
Úvod do lineárního modelování v Pythonu
Pokyny k cvičení
- Pomocí
np.random.choice()vybersample_indszpopulation_indstak, aby zůstalo zachováno párování vzdálenosti a času pro každý datový bod. - Aby bylo zachováno časové pořadí, seřaď
sample_indsmetodou.sort()a pak je použij jako index prodistancesatimes. - Pomocí
least_squares(times, distances)vypočítej parametry lineárního modelu a uloža1doresample_speeds. - Aplikuj
np.mean()anp.percentiles()naresample_speeds, vypočítej rychlost a interval spolehlivostici_90a oba výsledky vypiš.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Resample each preloaded population, and compute speed distribution
population_inds = np.arange(0, 99, dtype=int)
for nr in range(num_resamples):
sample_inds = np.random.choice(____, size=100, replace=True)
sample_inds.____()
sample_distances = distances[____]
sample_times = times[____]
a0, a1 = ____(sample_times, sample_distances)
resample_speeds[nr] = ____
# Compute effect size and confidence interval, and print
speed_estimate = np.mean(____)
ci_90 = np.percentile(____, [5, 95])
print('Speed Estimate = {:0.2f}, 90% Confidence Interval: {:0.2f}, {:0.2f} '.format(____, ____[0], ____[1]))