拆分并展开文本列
已提供一个包含 100 行的数据框 clauses_df。它有一个 clause 列和行 ID。每个 clause 是一个由空格分隔的一个或多个单词组成的字符串。
本练习是课程的一部分
Python 中的 Spark SQL 入门
练习说明
- 将
clause列拆分为名为words的列,其中包含由各个单词组成的数组。 - 将
words列展开为名为word的列。 - 统计生成的行数。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Split the clause column into a column called words
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)
# Explode the words column into a column called word
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)
# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)