Hledání duplicit
Nová aktualizace datového pipeline napojená na ride_sharing přidala sloupec ride_id, který představuje jedinečný identifikátor každé jízdy.
Aktualizace ale přišla ruku v ruce s výrazně kratší průměrnou dobou jízd a neplatnými daty narození uživatelů nastavenými v budoucnosti. Nejdůležitější je, že počet zaznamenaných jízd přes noc vzrostl o 20 %, což vede k podezření, že DataFrame ride_sharing obsahuje jak úplné, tak neúplné duplicity.
V tomto cvičení toto podezření prověříš tím, že dané duplicity najdeš. V prostředí máš k dispozici vzorek dat ride_sharing a také všechny balíčky, se kterými jsi dosud pracoval/a.
Toto cvičení je součástí kurzu
Čištění dat v Pythonu
Pokyny k cvičení
- V DataFramu
ride_sharingnajdi duplicitní řádky sloupceride_ida nastav parametrkeepnaFalse. - Filtruj
ride_sharingpodleduplicates, seřaď výsledky podleride_ida ulož je do proměnnéduplicated_rides. - Vypiš sloupce
ride_id,durationauser_birth_yearzduplicated_ridesv tomto pořadí.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])