拆分与展开
把像 GARAGEDESCRIPTION 这样的复合字段整理成可用信息需要多个步骤。尽早判断展开后能获得哪些价值很有帮助。在本例中,您将把字符串转换为类似列表的数组,对其进行展开,然后查看其唯一值。
本练习是课程的一部分
使用 PySpark 进行特征工程
练习说明
- 从
pyspark.sql.functions导入所需的split()和explode()函数。 - 使用
split()按 ", "(逗号加空格)切分df['GARAGEDESCRIPTION'],创建新列garage_list。 - 使用
explode()为df['garage_list']中的每个值创建一条新记录,并将其赋给新列ex_garage_list。 - 使用
distinct()获取ex_garage_list的唯一值,并用show显示前 100 行,将显示内容截断为 50 个字符以便查看数值。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)