Začněte nyníZačněte zdarma

Velikost vzorku pro proporce

Reálná data bývají chaotická. Jako analytický inženýr pracující s daty v praxi se setkáš se situacemi, kdy je rozptyl dat příliš vysoký na to, aby bylo možné zachytit smysluplný rozdíl v metrikách. Tento problém nastává nejčastěji u spojitých metrik, jako je průměrná hodnota objednávky z předchozího cvičení. Existuje několik způsobů, jak to řešit – jedním z nich je najít metriku s nižším rozptylem, která přitom stále odpovídá obchodním cílům.

Tady se podíváš na výpočet velikosti vzorku pro binární metriku: míru registrací, která vyjadřuje, zda se uživatel zaregistroval ke službě nebo ne – na rozdíl od zaplacené ceny, která se mezi uživateli může výrazně lišit. DataFrame homepage a knihovny pandas a numpy jsou už načteny, stejně jako proportion_effectsize z statsmodels.stats.proportion a power z statsmodels.stats.

Toto cvičení je součástí kurzu

A/B testování v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Calculate the baseline signup rate for group A
p_A = ____
print('Group A mean signup rate:', ____)
Upravit a spustit kód