Hitta dubbletter
En ny uppdatering av datapipelinen som matar in data i ride_sharing har lagt till kolumnen ride_id, som representerar en unik identifierare för varje resa.
Uppdateringen sammanföll dock med drastiskt kortare genomsnittliga reselängder och ovanliga användarfödelseår satta i framtiden. Viktigast av allt: antalet resor ökade med 20 % på en natt, vilket får dig att misstänka att det kan finnas både fullständiga och ofullständiga dubbletter i DataFrame:n ride_sharing.
I den här övningen ska du bekräfta den misstanken genom att hitta dessa dubbletter. Ett urval av ride_sharing finns i din miljö, tillsammans med alla paket du har arbetat med hittills.
Den här övningen är en del av kursen
Datarensning i Python
Övningsinstruktioner
- Hitta duplicerade rader för
ride_idi DataFrame:nride_sharingoch sättkeeptillFalse. - Filtrera
ride_sharingpåduplicates, sortera påride_idoch tilldela resultatet tillduplicated_rides. - Skriv ut kolumnerna
ride_id,durationochuser_birth_yearfrånduplicated_ridesi den ordningen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])