Tìm bản ghi trùng lặp
Một bản cập nhật mới cho pipeline dữ liệu cấp vào ride_sharing đã thêm cột ride_id, đại diện cho mã định danh duy nhất của mỗi chuyến đi.
Tuy nhiên, bản cập nhật này trùng với việc thời lượng chuyến đi trung bình giảm mạnh và có các năm sinh người dùng bất thường đặt ở tương lai. Quan trọng hơn, số chuyến đi đã tăng 20% chỉ sau một đêm, khiến bạn nghi ngờ rằng có cả bản ghi trùng lặp hoàn chỉnh và không hoàn chỉnh trong DataFrame ride_sharing.
Trong bài tập này, bạn sẽ kiểm chứng nghi ngờ đó bằng cách tìm các bản ghi trùng lặp. Một mẫu của ride_sharing đã có trong môi trường của bạn, cùng với tất cả các gói bạn đã dùng từ trước đến nay.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu với Python
Hướng dẫn bài tập
- Tìm các hàng có
ride_idtrùng lặp trong DataFrameride_sharingvà đặtkeeplàFalse. - Lọc
ride_sharingtheoduplicates, sắp xếp theoride_idvà gán kết quả choduplicated_rides. - In các cột
ride_id,durationvàuser_birth_yearcủaduplicated_ridestheo đúng thứ tự đó.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])