Wyszukiwanie duplikatów
Nowa aktualizacja potoku danych zasilającego ride_sharing dodała kolumnę ride_id, która stanowi unikalny identyfikator każdego przejazdu.
Aktualizacja zbiegła się jednak ze znacznie krótszymi średnimi czasami przejazdów oraz nieprawidłowymi datami urodzenia użytkowników ustawionymi w przyszłości. Co ważniejsze, liczba zarejestrowanych przejazdów wzrosła o 20% z dnia na dzień – to skłania do podejrzeń, że w ramce danych ride_sharing mogą znajdować się zarówno kompletne, jak i niekompletne duplikaty.
W tym ćwiczeniu potwierdzisz te podejrzenia, wyszukując owe duplikaty. W środowisku masz dostęp do próbki zbioru ride_sharing oraz wszystkich pakietów, z których korzystałeś do tej pory.
To ćwiczenie jest częścią kursu
Czyszczenie danych w Pythonie
Instrukcje do ćwiczenia
- Znajdź zduplikowane wiersze kolumny
ride_idw ramce danychride_sharing, ustawiając parametrkeepnaFalse. - Odfiltruj ramkę
ride_sharingna podstawieduplicates, posortuj wyniki wedługride_idi zapisz je do zmiennejduplicated_rides. - Wyświetl kolumny
ride_id,durationorazuser_birth_yearz ramkiduplicated_ridesw tej kolejności.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])