开始使用免费开始使用

拆分与展开

把像 GARAGEDESCRIPTION 这样的复合字段整理成可用信息需要多个步骤。尽早判断展开后能获得哪些价值很有帮助。在本例中,您将把字符串转换为类似列表的数组,对其进行展开,然后查看其唯一值。

本练习是课程的一部分

使用 PySpark 进行特征工程

查看课程

练习说明

  • pyspark.sql.functions 导入所需的 split()explode() 函数。
  • 使用 split() 按 ", "(逗号加空格)切分 df['GARAGEDESCRIPTION'],创建新列 garage_list
  • 使用 explode()df['garage_list'] 中的每个值创建一条新记录,并将其赋给新列 ex_garage_list
  • 使用 distinct() 获取 ex_garage_list 的唯一值,并用 show 显示前 100 行,将显示内容截断为 50 个字符以便查看数值。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
编辑并运行代码