SQL dan Parquet
Berkas Parquet sangat cocok sebagai penyimpanan data pendukung untuk kueri SQL di Spark. Meskipun kueri yang sama dapat dijalankan langsung melalui fungsi Python milik Spark, terkadang lebih mudah menjalankan kueri SQL berdampingan dengan opsi Python.
Pada contoh ini, kita akan membaca berkas Parquet yang kita buat pada latihan sebelumnya dan mendaftarkannya sebagai tabel SQL. Setelah didaftarkan, kita akan menjalankan kueri singkat terhadap tabel tersebut (alias, berkas Parquet-nya).
Objek spark dan berkas AA_DFW_ALL.parquet telah tersedia untuk Anda secara otomatis.
Latihan ini merupakan bagian dari kursus
Membersihkan Data dengan PySpark
Instruksi latihan
- Impor berkas
AA_DFW_ALL.parquetkeflights_df. - Gunakan metode
createOrReplaceTempViewuntuk memberikan alias tabelflights. - Jalankan kueri Spark SQL terhadap tabel
flights.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Read the Parquet file into flights_df
flights_df = spark.read.____(____)
# Register the temp table
flights_df.____('flights')
# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)