始める無料で始める

遅延処理を使う

遅延処理の操作は、実際のデータ量にかかわらず、おおむね同じくらいの時間で返ってきます。これは、アクションが要求されるまで Spark が変換を実行しないためです。

この演習では、DataFrame(aa_dfw_df)を定義し、いくつかの変換を追加します。変換を定義したときと、実際にデータをクエリしたときで、完了にかかる時間の違いに注目してください。差は短いかもしれませんが、気づけるはずです。より大きなデータを扱うフルの Spark クラスターでは、その違いがより明確になります。

この演習はコースの一部です

PySpark でデータをクレンジングする

コースを見る

演習の手順

  • DataFrame を読み込みます。
  • Destination Airport 列に F.lower() の変換を追加します。
  • DataFrame を表示し、このアクションが完了するまでの時間の違いに注目します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')

# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))

# Show the DataFrame
____
コードを編集して実行