开始使用免费开始使用

使用 DataFrame

Spark 的核心数据结构是 Resilient Distributed Dataset(RDD,弹性分布式数据集)。这是一个较低层的对象,Spark 通过把数据拆分到集群中的多个节点来发挥威力。不过,直接使用 RDD 并不容易,因此本课程中,您将使用构建在 RDD 之上的 Spark DataFrame 抽象。

Spark DataFrame 的设计与 SQL 表非常相似(列是变量,行是观测)。DataFrame 不仅更容易理解,在处理复杂操作时也比 RDD 优化得更好。

当您开始修改并组合数据的列与行时,往往有多种方法能得到相同结果,但有些方法会慢得多。使用 RDD 时,需要数据科学家自行找出合适的查询优化方式;而 DataFrame 的实现内置了大量此类优化!

要开始使用 Spark DataFrame,首先需要从 SparkContext 创建一个 SparkSession 对象。可以把 SparkContext 看作是到集群的连接,而 SparkSession 则是与该连接交互的接口。

请记住,在本课程的其余部分,您的工作区中会提供名为 sparkSparkSession

以下哪一项是 Spark DataFrame 相较于 RDD 的优势?

本练习是课程的一部分

PySpark 基础

查看课程

动手互动练习

通过我们的互动练习之一,将理论转化为实践

开始练习