クイックなパイプライン
より複雑なデータをパースする前に、マネージャーから基本手順を含むシンプルなパイプライン例を見せてほしいと言われました。今回は、データファイルを取り込み、数行をフィルタリングし、ID 列を追加して、JSON データとして書き出します。
spark コンテキストは定義済みで、慣例どおり pyspark.sql.functions ライブラリは F の別名でインポートされています。
この演習はコースの一部です
PySpark でデータをクレンジングする
演習の手順
- ファイル
2015-departures.csv.gzを DataFrame にインポートします。ヘッダーは既に定義されています。 - DataFrame を、フライト時間が 0 分より長いものだけにフィルタリングします。列名ではなく列の「インデックス」を使ってください(列名や順序を確認するには
.printSchema()を使いましょう)。 - ID 列を追加します。
output.jsonという名前の JSON ドキュメントとして書き出します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the data to a DataFrame
departures_df = spark.____(____, header=____)
# Remove any duration of 0
departures_df = departures_df.____(____)
# Add an ID column
departures_df = departures_df.____('id', ____)
# Write the file out to JSON format
____.write.____(____, mode='overwrite')