开始使用免费开始使用

查找重复项

向为 ride_sharing 提供数据的数据管道进行了更新,新增了 ride_id 列,用于表示每次行程的唯一标识符。

然而,更新后平均行程时长大幅缩短,且出现了设置在未来的不规则用户出生日期。更重要的是,行程数量一夜之间增长了 20%,这让您怀疑 ride_sharing DataFrame 中可能同时存在完整和不完整的重复。

在本练习中,您将通过查找这些重复项来验证这一怀疑。环境中已提供 ride_sharing 的一个样本,以及到目前为止您一直在使用的所有软件包。

本练习是课程的一部分

Python 数据清洗

查看课程

练习说明

  • ride_sharing DataFrame 中查找 ride_id 的重复行,并将 keep 设为 False
  • duplicatesride_sharing 进行子集化,并按 ride_id 排序,将结果赋给 duplicated_rides
  • 按顺序打印 duplicated_ridesride_iddurationuser_birth_year 列。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Find duplicates
duplicates = ____.____(____, ____)

# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')

# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])
编辑并运行代码