查找重复项
向为 ride_sharing 提供数据的数据管道进行了更新,新增了 ride_id 列,用于表示每次行程的唯一标识符。
然而,更新后平均行程时长大幅缩短,且出现了设置在未来的不规则用户出生日期。更重要的是,行程数量一夜之间增长了 20%,这让您怀疑 ride_sharing DataFrame 中可能同时存在完整和不完整的重复。
在本练习中,您将通过查找这些重复项来验证这一怀疑。环境中已提供 ride_sharing 的一个样本,以及到目前为止您一直在使用的所有软件包。
本练习是课程的一部分
Python 数据清洗
练习说明
- 在
ride_sharingDataFrame 中查找ride_id的重复行,并将keep设为False。 - 以
duplicates对ride_sharing进行子集化,并按ride_id排序,将结果赋给duplicated_rides。 - 按顺序打印
duplicated_rides的ride_id、duration和user_birth_year列。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])