开始使用免费开始使用

批量删除列

我们的数据集包含很多特征,但并非都有价值。有些列很难整理成对建模有用的信息。现在,先删除那些当前不直接有用的列。

  • 'STREETNUMBERNUMERIC':房屋的邮寄地址门牌号
  • 'FIREPLACES':房屋中的壁炉数量
  • 'LOTSIZEDIMENSIONS':用自由文本描述的地块形状
  • 'LISTTYPE':销售类型的枚举取值
  • 'ACRES':地块面积的数值

本练习是课程的一部分

使用 PySpark 进行特征工程

查看课程

练习说明

  • 阅读上方的列说明,并使用 show() 查看其前 30 个取值;数据框已按所列列名过滤为 df
  • 根据对房价预测的相关性,创建一个待删除的 2 列列表,命名为 cols_to_drop。请注意,计算机只能明确处理数值,并不理解语境。
  • 使用 drop() 函数,从数据框 df 中删除 cols_to_drop 列表里的列。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
编辑并运行代码