Zacznij terazZacznij za darmo

Czyszczenie danych testu A/B

Czyszczenie danych do testów A/B nie różni się zasadniczo od standardowego procesu opisywanego w kursach poświęconych czyszczeniu i przetwarzaniu danych. Jednak zrozumienie kontekstu i sposobu rejestrowania danych w każdym teście A/B z osobna pozwala podejmować świadome decyzje o tym, jak postępować z nieporządnymi danymi. Usuwanie lub zachowywanie duplikatów i brakujących wartości to dwa przypadki, w których trzeba zachować szczególną ostrożność – ważne jest, aby definicje metryk były spójne dla wszystkich wariantów.

Ramki danych AdSmart i homepage oraz biblioteki pandas i numpy są już wczytane.

Źródło zbioru danych Adsmart z Kaggle znajdziesz tutaj.

To ćwiczenie jest częścią kursu

Testy A/B w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Check for duplicate rows due to logging issues 
print(____(AdSmart))
print(____(AdSmart.____(keep='____')))
Edytuj i uruchom kod