Kom igångKom igång gratis

Hitta dubbletter

En ny uppdatering av datapipelinen som matar in data i ride_sharing har lagt till kolumnen ride_id, som representerar en unik identifierare för varje resa.

Uppdateringen sammanföll dock med drastiskt kortare genomsnittliga reselängder och ovanliga användarfödelseår satta i framtiden. Viktigast av allt: antalet resor ökade med 20 % på en natt, vilket får dig att misstänka att det kan finnas både fullständiga och ofullständiga dubbletter i DataFrame:n ride_sharing.

I den här övningen ska du bekräfta den misstanken genom att hitta dessa dubbletter. Ett urval av ride_sharing finns i din miljö, tillsammans med alla paket du har arbetat med hittills.

Den här övningen är en del av kursen

Datarensning i Python

Visa kurs

Övningsinstruktioner

  • Hitta duplicerade rader för ride_id i DataFrame:n ride_sharing och sätt keep till False.
  • Filtrera ride_sharingduplicates, sortera på ride_id och tilldela resultatet till duplicated_rides.
  • Skriv ut kolumnerna ride_id, duration och user_birth_year från duplicated_rides i den ordningen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Find duplicates
duplicates = ____.____(____, ____)

# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')

# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])
Redigera och kör kod