開始使用免費開始

尋找重複值

送入 ride_sharing 的資料管線有了新更新,新增了 ride_id 欄位,代表每趟行程的唯一識別碼。

然而更新後,平均行程時間突然大幅縮短,而且有使用者的出生年份被設在未來。更重要的是,行程總數在一夜之間增加了 20%,讓你懷疑 ride_sharing DataFrame 中同時存在「完整」與「不完整」的重複資料。

在本練習中,你會透過找出這些重複值來驗證這個猜測。環境中已提供 ride_sharing 的範例,以及你到目前為止使用過的所有套件。

本練習屬於課程

用 Python 進行資料清理

檢視課程

練習說明

  • ride_sharing DataFrame 中找出 ride_id 的重複列,並將 keep 設為 False
  • duplicates 子集化 ride_sharing,再依 ride_id 排序,並將結果指定給 duplicated_rides
  • 依序列印 duplicated_ridesride_iddurationuser_birth_year 欄位。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Find duplicates
duplicates = ____.____(____, ____)

# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')

# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])
編輯並執行程式碼