开始使用免费开始使用

在 RDD 中做聚合

您已经在 PySpark 中用 DataFrame 做过分析。现在让我们用 RDD 做一个类似的小任务。请使用提供的代码,在 PySpark 中计算一个 RDD 的值之和。

名为 spark 的 Spark 会话已为您创建。

本练习是课程的一部分

PySpark 入门

查看课程

练习说明

  • 从提供的 DataFrame 创建一个 RDD。
  • 将提供的 Lambda 函数应用到 RDD 的键上。
  • 收集聚合结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)

# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))

# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)

# Show the collected Results
print(rdd_aggregated.____())
编辑并运行代码