テキスト列を split と explode で展開する
100 行のデータフレーム clauses_df が用意されています。clause 列と行IDを持ちます。各 clause は、スペースで区切られた1語以上の文字列です。
この演習はコースの一部です
Pythonで学ぶ Spark SQL 入門
演習の手順
clause列を分割して、個々の単語の配列を含むwords列を作成します。words列を explode して、word列を作成します。- 最終的な行数を数えます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Split the clause column into a column called words
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)
# Explode the words column into a column called word
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)
# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)