Menyimpan DataFrame dalam format Parquet
Saat bekerja dengan Spark, Anda sering memulai dari CSV, JSON, atau sumber data lainnya. Ini memberi banyak fleksibilitas untuk jenis data yang dimuat, tetapi bukan format yang optimal untuk Spark. Format Parquet adalah penyimpanan data kolumnar, yang memungkinkan Spark menggunakan predicate pushdown. Artinya, Spark hanya akan memproses data yang diperlukan untuk menyelesaikan operasi yang Anda tentukan, alih-alih membaca seluruh himpunan data. Hal ini memberi Spark fleksibilitas lebih dalam mengakses data dan sering kali sangat meningkatkan performa pada himpunan data besar.
Di latihan ini, Anda akan berlatih membuat file Parquet baru lalu memproses sebagian data darinya.
Objek spark serta DataFrame df1 dan df2 telah disiapkan untuk Anda.
Latihan ini merupakan bagian dari kursus
Membersihkan Data dengan PySpark
Instruksi latihan
- Lihat jumlah baris dari
df1dandf2. - Gabungkan
df1dandf2ke dalam DataFrame baru bernamadf3menggunakan metodeunion. - Simpan
df3ke fileparquetbernamaAA_DFW_ALL.parquet. - Baca file
AA_DFW_ALL.parquetdan tampilkan hitungannya.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())
# Combine the DataFrames into one
df3 = df1.union(df2)
# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')
# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())