Розмір вибірки для часток
Реальні набори даних можуть бути „шумними". Як аналітик-інженер, який працює з даними у реальному світі, ви зіткнетеся із ситуаціями, коли дисперсія в даних занадто велика, щоб упіймати суттєву різницю в метриках. Це частіше трапляється з неперервними метриками, як-от середня вартість замовлення в попередній вправі. Є кілька способів це вирішити, але один із підходів — знайти метрику з нижчою дисперсією, яка все ж відповідає бізнес-цілям.
Тут ви розглянете обчислення розміру вибірки для бінарної метрики — частки реєстрацій, яка відображає, чи користувач зареєструвався на сервіс, на відміну від сплаченої суми, що може сильніше відрізнятися між користувачами. Датафрейм homepage і бібліотеки pandas, numpy вже завантажені для вас, так само як proportion_effectsize з statsmodels.stats.proportion та power з statsmodels.stats.
Ця вправа є частиною курсу
A/B Testing на Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Calculate the baseline signup rate for group A
p_A = ____
print('Group A mean signup rate:', ____)