ПочатиПочніть безкоштовно

Розмір вибірки для часток

Реальні набори даних можуть бути „шумними". Як аналітик-інженер, який працює з даними у реальному світі, ви зіткнетеся із ситуаціями, коли дисперсія в даних занадто велика, щоб упіймати суттєву різницю в метриках. Це частіше трапляється з неперервними метриками, як-от середня вартість замовлення в попередній вправі. Є кілька способів це вирішити, але один із підходів — знайти метрику з нижчою дисперсією, яка все ж відповідає бізнес-цілям.

Тут ви розглянете обчислення розміру вибірки для бінарної метрики — частки реєстрацій, яка відображає, чи користувач зареєструвався на сервіс, на відміну від сплаченої суми, що може сильніше відрізнятися між користувачами. Датафрейм homepage і бібліотеки pandas, numpy вже завантажені для вас, так само як proportion_effectsize з statsmodels.stats.proportion та power з statsmodels.stats.

Ця вправа є частиною курсу

A/B Testing на Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Calculate the baseline signup rate for group A
p_A = ____
print('Group A mean signup rate:', ____)
Редагувати та запускати код