Mulai sekarangMulai gratis

SQL dan Parquet

Berkas Parquet sangat cocok sebagai penyimpanan data pendukung untuk kueri SQL di Spark. Meskipun kueri yang sama dapat dijalankan langsung melalui fungsi Python milik Spark, terkadang lebih mudah menjalankan kueri SQL berdampingan dengan opsi Python.

Pada contoh ini, kita akan membaca berkas Parquet yang kita buat pada latihan sebelumnya dan mendaftarkannya sebagai tabel SQL. Setelah didaftarkan, kita akan menjalankan kueri singkat terhadap tabel tersebut (alias, berkas Parquet-nya).

Objek spark dan berkas AA_DFW_ALL.parquet telah tersedia untuk Anda secara otomatis.

Latihan ini merupakan bagian dari kursus

Membersihkan Data dengan PySpark

Lihat Kursus

Instruksi latihan

  • Impor berkas AA_DFW_ALL.parquet ke flights_df.
  • Gunakan metode createOrReplaceTempView untuk memberikan alias tabel flights.
  • Jalankan kueri Spark SQL terhadap tabel flights.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
Edit dan Jalankan Kode