尋找重複值
送入 ride_sharing 的資料管線有了新更新,新增了 ride_id 欄位,代表每趟行程的唯一識別碼。
然而更新後,平均行程時間突然大幅縮短,而且有使用者的出生年份被設在未來。更重要的是,行程總數在一夜之間增加了 20%,讓你懷疑 ride_sharing DataFrame 中同時存在「完整」與「不完整」的重複資料。
在本練習中,你會透過找出這些重複值來驗證這個猜測。環境中已提供 ride_sharing 的範例,以及你到目前為止使用過的所有套件。
本練習屬於課程
用 Python 進行資料清理
練習說明
- 在
ride_sharingDataFrame 中找出ride_id的重複列,並將keep設為False。 - 以
duplicates子集化ride_sharing,再依ride_id排序,並將結果指定給duplicated_rides。 - 依序列印
duplicated_rides的ride_id、duration、user_birth_year欄位。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])