Velikost vzorku pro proporce
Reálná data bývají chaotická. Jako analytický inženýr pracující s daty v praxi se setkáš se situacemi, kdy je rozptyl dat příliš vysoký na to, aby bylo možné zachytit smysluplný rozdíl v metrikách. Tento problém nastává nejčastěji u spojitých metrik, jako je průměrná hodnota objednávky z předchozího cvičení. Existuje několik způsobů, jak to řešit – jedním z nich je najít metriku s nižším rozptylem, která přitom stále odpovídá obchodním cílům.
Tady se podíváš na výpočet velikosti vzorku pro binární metriku: míru registrací, která vyjadřuje, zda se uživatel zaregistroval ke službě nebo ne – na rozdíl od zaplacené ceny, která se mezi uživateli může výrazně lišit. DataFrame homepage a knihovny pandas a numpy jsou už načteny, stejně jako proportion_effectsize z statsmodels.stats.proportion a power z statsmodels.stats.
Toto cvičení je součástí kurzu
A/B testování v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Calculate the baseline signup rate for group A
p_A = ____
print('Group A mean signup rate:', ____)