Nestandardní odhadce
V předchozím cvičení jsi spustil/a jednoduchý bootstrap, který teď upravíme pro složitější odhadce.
Představ si, že zkoumáš zdravotní stav studentů. Máš k dispozici výšky a váhy 1 000 studentů a zajímá tě medián výšky, korelace mezi výškou a váhou a příslušné 95% intervaly spolehlivosti pro tyto veličiny. Použijeme bootstrapping.
Prohlédni si DataFrame df z knihovny pandas, který obsahuje výšky a váhy 1 000 studentů. Na základě těchto dat vypočítej 95% interval spolehlivosti pro medián výšky i pro korelaci mezi výškou a váhou.
Toto cvičení je součástí kurzu
Statistické simulace v Pythonu
Pokyny k cvičení
- Pomocí metody
.sample()nadfvygeneruj vzorek dat s opakováním a přiřaď ho dotmp_df. - Pro každý vygenerovaný dataset v
tmp_dfvypočítej medián výšek a korelaci mezi výškou a váhou pomocí.median()a.corr(). - Přidej medián výšek do
height_mediansa korelaci dohw_corr. - Nakonec vypočítej 95% (
[2.5, 97.5]) intervaly spolehlivosti pro obě výše uvedené veličiny pomocínp.percentile().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Sample with replacement and calculate quantities of interest
sims, data_size, height_medians, hw_corr = 1000, df.shape[0], [], []
for i in range(sims):
tmp_df = ____(n=____, replace=____)
height_medians.append(____)
hw_corr.append(____)
# Calculate confidence intervals
height_median_ci = np.____
height_weight_corr_ci = np.____
print("Height Median CI = {} \nHeight Weight Correlation CI = {}".format( height_median_ci, height_weight_corr_ci))