批量删除列
我们的数据集包含很多特征,但并非都有价值。有些列很难整理成对建模有用的信息。现在,先删除那些当前不直接有用的列。
'STREETNUMBERNUMERIC':房屋的邮寄地址门牌号'FIREPLACES':房屋中的壁炉数量'LOTSIZEDIMENSIONS':用自由文本描述的地块形状'LISTTYPE':销售类型的枚举取值'ACRES':地块面积的数值
本练习是课程的一部分
使用 PySpark 进行特征工程
练习说明
- 阅读上方的列说明,并使用
show()查看其前 30 个取值;数据框已按所列列名过滤为df。 - 根据对房价预测的相关性,创建一个待删除的 2 列列表,命名为
cols_to_drop。请注意,计算机只能明确处理数值,并不理解语境。 - 使用
drop()函数,从数据框df中删除cols_to_drop列表里的列。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)