Размер выборки для пропорций
Реальные данные бывают неупорядоченными. Работая аналитиком данных с реальными наборами данных, вы будете сталкиваться с ситуациями, когда дисперсия данных слишком велика, чтобы зафиксировать значимое различие в метриках. Эта проблема чаще возникает с непрерывными метриками, например средней стоимостью заказа из предыдущего упражнения. Существует несколько способов её решить, и один из них — найти метрику с меньшей дисперсией, которая при этом соответствует бизнес-целям.
Здесь вы рассмотрите вычисление размера выборки для бинарной метрики — коэффициента регистрации, отражающего, подписался ли пользователь на сервис, в отличие от суммы оплаты, которая может сильнее варьироваться от пользователя к пользователю. DataFrame homepage, библиотеки pandas и numpy уже загружены, а также proportion_effectsize из statsmodels.stats.proportion и power из statsmodels.stats.
Это упражнение является частью курса
A/B-тестирование в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Calculate the baseline signup rate for group A
p_A = ____
print('Group A mean signup rate:', ____)