识别缺失值
在进行缺失值填补之前,第一步是判断数据中是否存在缺失值,以及这些缺失值分别来自哪些分组。
在与课中相同的 restaurant_data 数据里,有位员工误删了 65 张餐桌的小费记录。现在的问题是:这些缺失记录有多少来自有吸烟者在场的餐桌,与无吸烟者在场的餐桌分别是多少?
您的任务是按 smoker 变量对数据分组,统计每个分组中非缺失值的数量,然后计算缺失值的数量与差异。
我们在这里对小费进行填补是为了帮助您练习本节课的概念。从伦理角度出发,现实中不应对财务数据进行填补,否则可能被视为欺诈。
本练习是课程的一部分
使用 pandas 编写高效代码
练习说明
- 按吸烟状态对数据进行分组。
- 计算每个分组中的非缺失值数量。
- 打印每个分组中的缺失值数量。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Group both objects according to smoke condition
restaurant_nan_grouped = restaurant_nan.____(____)
# Store the number of present values
restaurant_nan_nval = restaurant_nan_grouped['tip'].____()
# Print the group-wise missing entries
print(restaurant_nan_grouped['total_bill'].count() - ____)