शुरू करेंमुफ़्त में शुरू करें

RDDs में Aggregation

अब जब आपने PySpark में DataFrames के साथ एनालिटिक्स किया है, तो चलिए RDD के साथ भी संक्षेप में वही काम करते हैं. दिए गए कोड का उपयोग करके, PySpark में एक RDD के values का sum निकालिए.

spark नाम का Spark session पहले से आपके लिए बनाया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • दिए गए DataFrame से एक RDD बनाएँ.
  • दिए गए Lambda Function को RDD की keys पर लागू करें.
  • एग्रीगेशन के परिणाम collect करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)

# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))

# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)

# Show the collected Results
print(rdd_aggregated.____())
कोड संपादित करें और चलाएँ