शुरू करेंमुफ़्त में शुरू करें

फ़िल्टर और काउंट

RDD ट्रांसफॉर्मेशन filter() एक नया RDD लौटाता है जिसमें केवल वे एलिमेंट्स होते हैं जो दी गई फंक्शन की शर्त पूरी करते हैं. यह किसी कीवर्ड के आधार पर बड़े डेटासेट को फ़िल्टर करने में उपयोगी है. इस अभ्यास में, आप fileRDD RDD से वे सभी लाइनें फ़िल्टर करेंगे जिनमें कीवर्ड Spark आता है. fileRDD में README.md फाइल की टेक्स्ट लाइन्स हैं. अगला कदम, कीवर्ड Spark वाली कुल लाइनों की संख्या काउंट करना है और अंत में फ़िल्टर किए गए RDD की पहली 4 लाइनें प्रिंट करनी हैं.

ध्यान रखें, आपके वर्कस्पेस में SparkContext sc, file_path, और fileRDD पहले से उपलब्ध हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • filter() ट्रांसफॉर्मेशन बनाइए ताकि कीवर्ड Spark वाली लाइनों का चयन हो सके.
  • fileRDD_filter में कीवर्ड Spark वाली कुल कितनी लाइनें हैं?
  • प्राप्त RDD की पहली चार लाइनें प्रिंट कीजिए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
कोड संपादित करें और चलाएँ