Очищення даних для A/B‑тесту
Очищення даних для A/B‑тестування не відрізняється від стандартного процесу, який ви проходили в курсах з очищення та обробки даних. Втім, розуміння контексту й особливостей логування подій у кожному конкретному A/B‑тесті допомагає ухвалювати рішення щодо роботи з «брудними» даними. Видаляти чи залишати дублікати та пропуски — це два випадки, де слід уважно перевірити визначення метрик і їх узгодженість між варіантами.
Датафрейми AdSmart і homepage, а також бібліотеки pandas і numpy уже завантажено для вас.
Джерело набору даних Adsmart з Kaggle наведено тут: посилання
Ця вправа є частиною курсу
A/B Testing на Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Check for duplicate rows due to logging issues
print(____(AdSmart))
print(____(AdSmart.____(keep='____')))