始める無料で始める

テキスト列を split と explode で展開する

100 行のデータフレーム clauses_df が用意されています。clause 列と行IDを持ちます。各 clause は、スペースで区切られた1語以上の文字列です。

この演習はコースの一部です

Pythonで学ぶ Spark SQL 入門

コースを見る

演習の手順

  • clause 列を分割して、個々の単語の配列を含む words 列を作成します。
  • words 列を explode して、word 列を作成します。
  • 最終的な行数を数えます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Split the clause column into a column called words 
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)

# Explode the words column into a column called word 
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)

# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)
コードを編集して実行