开始使用免费开始使用

拆分并展开文本列

已提供一个包含 100 行的数据框 clauses_df。它有一个 clause 列和行 ID。每个 clause 是一个由空格分隔的一个或多个单词组成的字符串。

本练习是课程的一部分

Python 中的 Spark SQL 入门

查看课程

练习说明

  • clause 列拆分为名为 words 的列,其中包含由各个单词组成的数组。
  • words 列展开为名为 word 的列。
  • 统计生成的行数。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Split the clause column into a column called words 
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)

# Explode the words column into a column called word 
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)

# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)
编辑并运行代码