НачатьНачать бесплатно

Размер выборки для пропорций

Реальные данные бывают неупорядоченными. Работая аналитиком данных с реальными наборами данных, вы будете сталкиваться с ситуациями, когда дисперсия данных слишком велика, чтобы зафиксировать значимое различие в метриках. Эта проблема чаще возникает с непрерывными метриками, например средней стоимостью заказа из предыдущего упражнения. Существует несколько способов её решить, и один из них — найти метрику с меньшей дисперсией, которая при этом соответствует бизнес-целям.

Здесь вы рассмотрите вычисление размера выборки для бинарной метрики — коэффициента регистрации, отражающего, подписался ли пользователь на сервис, в отличие от суммы оплаты, которая может сильнее варьироваться от пользователя к пользователю. DataFrame homepage, библиотеки pandas и numpy уже загружены, а также proportion_effectsize из statsmodels.stats.proportion и power из statsmodels.stats.

Это упражнение является частью курса

A/B-тестирование в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Calculate the baseline signup rate for group A
p_A = ____
print('Group A mean signup rate:', ____)
Редактировать и запускать код