Mulai sekarangMulai gratis

Pipeline cepat

Sebelum Anda mengurai data yang lebih kompleks, manajer Anda ingin melihat contoh pipeline sederhana yang mencakup langkah-langkah dasar. Untuk contoh ini, Anda akan mengimpor sebuah berkas data, memfilter beberapa baris, menambahkan kolom ID, lalu menuliskannya sebagai data JSON.

Konteks spark sudah didefinisikan, beserta pustaka pyspark.sql.functions yang diberi alias F sesuai kebiasaan.

Latihan ini merupakan bagian dari kursus

Membersihkan Data dengan PySpark

Lihat Kursus

Instruksi latihan

  • Impor berkas 2015-departures.csv.gz ke sebuah DataFrame. Perhatikan bahwa header sudah didefinisikan.
  • Filter DataFrame agar hanya berisi penerbangan dengan durasi lebih dari 0 menit. Gunakan indeks kolom, bukan nama kolom (ingat gunakan .printSchema() untuk melihat nama/urutan kolom).
  • Tambahkan sebuah kolom ID.
  • Tulis berkas keluar sebagai dokumen JSON bernama output.json.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Import the data to a DataFrame
departures_df = spark.____(____, header=____)

# Remove any duration of 0
departures_df = departures_df.____(____)

# Add an ID column
departures_df = departures_df.____('id', ____)

# Write the file out to JSON format
____.write.____(____, mode='overwrite')
Edit dan Jalankan Kode