Pulizia dei dati di un test A/B
La pulizia dei dati nei test A/B non è diversa dal normale processo che impari nei corsi di pulizia e manipolazione dei dati. Tuttavia, capire il contesto e come vengono registrati i dati in ciascun test A/B, caso per caso, ti permette di decidere come gestire i dati disordinati. Eliminare o mantenere duplicati o valori mancanti sono due situazioni in cui dobbiamo fare attenzione a come definiamo le metriche e a quanto siano coerenti tra le varianti.
I DataFrame AdSmart e homepage, così come le librerie pandas e numpy, sono già caricati per te.
La fonte del dataset Adsmart su Kaggle è collegata qui. (https://www.kaggle.com/datasets/osuolaleemmanuel/ad-ab-testing)
Questo esercizio fa parte del corso
A/B Testing in Python
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Check for duplicate rows due to logging issues
print(____(AdSmart))
print(____(AdSmart.____(keep='____')))