Găsirea duplicatelor
O actualizare recentă a pipeline-ului de date care alimentează ride_sharing a adăugat coloana ride_id, ce reprezintă un identificator unic pentru fiecare cursă.
Actualizarea a coincis însă cu durate medii ale curselor brusc mai scurte și cu date de naștere ale utilizatorilor setate în viitor. Mai important, numărul de curse a crescut cu 20% peste noapte, ceea ce te face să suspectezi că există atât duplicate complete, cât și incomplete în DataFrame-ul ride_sharing.
În acest exercițiu, vei confirma această suspiciune identificând acele duplicate. În mediul tău se află un eșantion din ride_sharing, alături de toate pachetele cu care ai lucrat până acum.
Acest exercițiu face parte din cursul
Curățarea datelor în Python
Instrucțiuni pentru exercițiu
- Găsește rândurile duplicate din coloana
ride_ida DataFrame-uluiride_sharing, setândkeeplaFalse. - Filtrează
ride_sharingdupăduplicates, sortează rezultatele dupăride_idși atribuie-le variabileiduplicated_rides. - Afișează coloanele
ride_id,durationșiuser_birth_yeardinduplicated_rides, în această ordine.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])