त्वरित पाइपलाइन
अधिक जटिल डेटा पार्स करने से पहले, आपका मैनेजर बेसिक स्टेप्स सहित एक सरल पाइपलाइन का उदाहरण देखना चाहता है. इस उदाहरण में, आप एक डेटा फ़ाइल ingest करेंगे, कुछ पंक्तियाँ फ़िल्टर करेंगे, उसमें एक ID कॉलम जोड़ेंगे, और फिर उसे JSON डेटा के रूप में लिखेंगे.
spark कॉन्टेक्स्ट परिभाषित है, और pyspark.sql.functions लाइब्रेरी को प्रचलित तरीके से F उपनाम दिया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ डेटा क्लीनिंग
अभ्यास निर्देश
- फ़ाइल
2015-departures.csv.gzको एक DataFrame में इम्पोर्ट करें. ध्यान दें कि हेडर पहले से परिभाषित है. - DataFrame को केवल उन्हीं flights तक फ़िल्टर करें जिनकी duration 0 मिनट से अधिक है. कॉलम के नाम के बजाय कॉलम के index का उपयोग करें (कॉलम के नाम/क्रम देखने के लिए
.printSchema()उपयोग करना याद रखें). - एक ID कॉलम जोड़ें.
- फ़ाइल को
output.jsonनाम के JSON डॉक्यूमेंट के रूप में लिखें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the data to a DataFrame
departures_df = spark.____(____, header=____)
# Remove any duration of 0
departures_df = departures_df.____(____)
# Add an ID column
departures_df = departures_df.____('id', ____)
# Write the file out to JSON format
____.write.____(____, mode='overwrite')