Začněte nyníZačněte zdarma

Nestandardní odhadce

V předchozím cvičení jsi spustil/a jednoduchý bootstrap, který teď upravíme pro složitější odhadce.

Představ si, že zkoumáš zdravotní stav studentů. Máš k dispozici výšky a váhy 1 000 studentů a zajímá tě medián výšky, korelace mezi výškou a váhou a příslušné 95% intervaly spolehlivosti pro tyto veličiny. Použijeme bootstrapping.

Prohlédni si DataFrame df z knihovny pandas, který obsahuje výšky a váhy 1 000 studentů. Na základě těchto dat vypočítej 95% interval spolehlivosti pro medián výšky i pro korelaci mezi výškou a váhou.

Toto cvičení je součástí kurzu

Statistické simulace v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Pomocí metody .sample() na df vygeneruj vzorek dat s opakováním a přiřaď ho do tmp_df.
  • Pro každý vygenerovaný dataset v tmp_df vypočítej medián výšek a korelaci mezi výškou a váhou pomocí .median() a .corr().
  • Přidej medián výšek do height_medians a korelaci do hw_corr.
  • Nakonec vypočítej 95% ([2.5, 97.5]) intervaly spolehlivosti pro obě výše uvedené veličiny pomocí np.percentile().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Sample with replacement and calculate quantities of interest
sims, data_size, height_medians, hw_corr = 1000, df.shape[0], [], []
for i in range(sims):
    tmp_df = ____(n=____, replace=____)
    height_medians.append(____)
    hw_corr.append(____)

# Calculate confidence intervals
height_median_ci = np.____
height_weight_corr_ci = np.____
print("Height Median CI = {} \nHeight Weight Correlation CI = {}".format( height_median_ci, height_weight_corr_ci))
Upravit a spustit kód