开始使用免费开始使用

并行化集合创建 RDD

弹性分布式数据集(RDD)是 Spark 的基本抽象。它是不可变的、分布式的对象集合。由于 RDD 是 Spark 的基础和骨干数据类型,理解如何创建它非常重要。在本练习中,您将从一个单词集合在 PySpark 中创建您的第一个 RDD。

请记住,您的工作区中已经提供了 SparkContext sc

本练习是课程的一部分

使用 PySpark 的大数据基础

查看课程

练习说明

  • 由一个包含单词的 Python 列表 创建名为 RDD 的 RDD。
  • 确认创建的对象确实是 RDD。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
编辑并运行代码