开始使用免费开始使用

识别缺失值

在进行缺失值填补之前,第一步是判断数据中是否存在缺失值,以及这些缺失值分别来自哪些分组。

在与课中相同的 restaurant_data 数据里,有位员工误删了 65 张餐桌的小费记录。现在的问题是:这些缺失记录有多少来自有吸烟者在场的餐桌,与无吸烟者在场的餐桌分别是多少?

您的任务是按 smoker 变量对数据分组,统计每个分组中非缺失值的数量,然后计算缺失值的数量与差异。

我们在这里对小费进行填补是为了帮助您练习本节课的概念。从伦理角度出发,现实中不应对财务数据进行填补,否则可能被视为欺诈。

本练习是课程的一部分

使用 pandas 编写高效代码

查看课程

练习说明

  • 按吸烟状态对数据进行分组。
  • 计算每个分组中的非缺失值数量。
  • 打印每个分组中的缺失值数量。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Group both objects according to smoke condition
restaurant_nan_grouped = restaurant_nan.____(____)

# Store the number of present values
restaurant_nan_nval = restaurant_nan_grouped['tip'].____()

# Print the group-wise missing entries
print(restaurant_nan_grouped['total_bill'].count() - ____)
编辑并运行代码