遅延処理を使う
遅延処理の操作は、実際のデータ量にかかわらず、おおむね同じくらいの時間で返ってきます。これは、アクションが要求されるまで Spark が変換を実行しないためです。
この演習では、DataFrame(aa_dfw_df)を定義し、いくつかの変換を追加します。変換を定義したときと、実際にデータをクエリしたときで、完了にかかる時間の違いに注目してください。差は短いかもしれませんが、気づけるはずです。より大きなデータを扱うフルの Spark クラスターでは、その違いがより明確になります。
この演習はコースの一部です
PySpark でデータをクレンジングする
演習の手順
- DataFrame を読み込みます。
Destination Airport列にF.lower()の変換を追加します。- DataFrame を表示し、このアクションが完了するまでの時間の違いに注目します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')
# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))
# Show the DataFrame
____