शुरू करेंमुफ़्त में शुरू करें

PySpark शेल में डेटा लोड करना

PySpark में, हम अपनी computation को distributed collections पर ऑपरेशन्स के ज़रिए व्यक्त करते हैं, जो क्लस्टर में अपने-आप parallelize हो जाती हैं। पिछले अभ्यास में आपने एक list को parallelized collection के रूप में लोड करने का उदाहरण देखा था, और इस अभ्यास में आप PySpark शेल में किसी लोकल फ़ाइल से डेटा लोड करेंगे.

ध्यान रखें, आपके वर्कस्पेस में पहले से SparkContext sc और file_path वैरिएबल (जो README.md फ़ाइल का path है) मौजूद हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • PySpark शेल में लोकल टेक्स्ट फ़ाइल README.md लोड करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load a local file into PySpark shell
lines = sc.____(file_path)
कोड संपादित करें और चलाएँ