开始使用免费开始使用

缺失数据填补

缺失数据很常见。如果我们假设数据是完全随机缺失,那么就等于认为现有数据能够很好地代表总体。如果只有少量缺失值,您可以删除这些样本,或者用均值或中位数进行替换。在本练习中,我们将查看 'PDOM':当前价格下的上市天数。

本练习是课程的一部分

使用 PySpark 进行特征工程

查看课程

练习说明

  • 使用 where()isNull()count() 统计 'PDOM' 列中的缺失值数量。
  • 使用聚合函数 mean() 计算 'PDOM' 的均值。
  • 使用 fillna(),将替换值设为 'PDOM' 的均值,并通过 subset 参数只作用于 'PDOM' 列。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Count missing rows
missing = df.____(df[____].____()).____()

# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]

# Replacing with the mean value for that column
df.____(____, ____=[____])
编辑并运行代码