फाइल इम्पोर्ट परफॉर्मेंस
आपको Spark DataFrame में इम्पोर्ट करने के लिए डेटा का बड़ा सेट दिया गया है. आप फाइल को बाँटकर इम्पोर्ट स्पीड में अंतर का परीक्षण करना चाहते हैं.
आपके पास दो तरह की फाइलें उपलब्ध हैं: departures_full.txt.gz और departures_xxx.txt.gz जहाँ xxx 000 - 013 है. समान संख्या की रो प्रत्येक फाइल में बाँटी गई है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ डेटा क्लीनिंग
अभ्यास निर्देश
departures_full.txt.gzफाइल औरdepartures_xxx.txt.gzफाइलों को अलग-अलग DataFrames में इम्पोर्ट करें.- हर DataFrame पर count चलाएँ और रन टाइम की तुलना करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)
# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))
start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))