शुरू करेंमुफ़्त में शुरू करें

External Datasets से RDDs

PySpark आसानी से उन फ़ाइलों से RDDs बना सकता है जो external storage devices, जैसे HDFS (Hadoop Distributed File System), Amazon S3 buckets, आदि पर स्टोर होती हैं। हालाँकि, RDDs बनाने का सबसे आम तरीका आपके local file system में स्टोर फ़ाइलों से होता है। यह तरीका एक file path लेता है और फ़ाइल को lines के कलेक्शन के रूप में पढ़ता है। इस अभ्यास में, आप README.md नाम की फ़ाइल के लिए दिए गए फ़ाइल पाथ (file_path) से एक RDD बनाएँगे, जो पहले से ही आपके workspace में उपलब्ध है।

ध्यान रखें, आपके workspace में SparkContext sc पहले से उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • PySpark shell में file_path प्रिंट करें।
  • file_path से fileRDD नाम का एक RDD बनाएँ।
  • बनाए गए fileRDD का type प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
कोड संपादित करें और चलाएँ