Parquet फ़ॉर्मेट में DataFrame सेव करना
Spark के साथ काम करते समय, आप अक्सर CSV, JSON, या अन्य डेटा सोर्स से शुरू करेंगे। यह लोड किए जाने वाले डेटा के प्रकारों के लिए काफी लचीलापन देता है, लेकिन Spark के लिए यह इष्टतम फ़ॉर्मेट नहीं है। Parquet फ़ॉर्मेट एक कॉलमनर डेटा स्टोर है, जो Spark को predicate pushdown का उपयोग करने देता है। इसका मतलब है कि Spark आपके द्वारा परिभाषित ऑपरेशंस को पूरा करने के लिए जितना आवश्यक डेटा है, केवल उतना ही प्रोसेस करेगा, पूरे डेटासेट को पढ़ने के बजाय। इससे Spark को डेटा तक पहुँच में अधिक लचीलापन मिलता है और बड़े डेटासेट्स पर परफॉर्मेंस अक्सर काफी बेहतर हो जाती है.
इस अभ्यास में, हम एक नया Parquet फ़ाइल बनाना और फिर उससे कुछ डेटा प्रोसेस करना प्रैक्टिस करेंगे.
spark ऑब्जेक्ट और df1 तथा df2 DataFrames आपके लिए सेटअप कर दिए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ डेटा क्लीनिंग
अभ्यास निर्देश
df1औरdf2की row count देखें.unionमेथड के साथdf1औरdf2को मिलाकरdf3नाम का नया DataFrame बनाएँ.df3कोAA_DFW_ALL.parquetनाम कीparquetफ़ाइल में सेव करें.AA_DFW_ALL.parquetफ़ाइल को पढ़ें और count दिखाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())
# Combine the DataFrames into one
df3 = df1.union(df2)
# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')
# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())