缺失数据填补
缺失数据很常见。如果我们假设数据是完全随机缺失,那么就等于认为现有数据能够很好地代表总体。如果只有少量缺失值,您可以删除这些样本,或者用均值或中位数进行替换。在本练习中,我们将查看 'PDOM':当前价格下的上市天数。
本练习是课程的一部分
使用 PySpark 进行特征工程
练习说明
- 使用
where()、isNull()和count()统计'PDOM'列中的缺失值数量。 - 使用聚合函数
mean()计算'PDOM'的均值。 - 使用
fillna(),将替换值设为'PDOM'的均值,并通过subset参数只作用于'PDOM'列。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Count missing rows
missing = df.____(df[____].____()).____()
# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]
# Replacing with the mean value for that column
df.____(____, ____=[____])