External Datasets से RDDs
PySpark आसानी से उन फ़ाइलों से RDDs बना सकता है जो external storage devices, जैसे HDFS (Hadoop Distributed File System), Amazon S3 buckets, आदि पर स्टोर होती हैं। हालाँकि, RDDs बनाने का सबसे आम तरीका आपके local file system में स्टोर फ़ाइलों से होता है। यह तरीका एक file path लेता है और फ़ाइल को lines के कलेक्शन के रूप में पढ़ता है। इस अभ्यास में, आप README.md नाम की फ़ाइल के लिए दिए गए फ़ाइल पाथ (file_path) से एक RDD बनाएँगे, जो पहले से ही आपके workspace में उपलब्ध है।
ध्यान रखें, आपके workspace में SparkContext sc पहले से उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
- PySpark shell में
file_pathप्रिंट करें। file_pathसेfileRDDनाम का एक RDD बनाएँ।- बनाए गए
fileRDDका type प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))