开始使用免费开始使用

在 Python 中使用 Spark

使用 Spark 的第一步是连接到一个集群。

在实际场景中,集群通常托管在一台远程机器上,并连接到其他所有节点。会有一台称为"主节点"(master)的计算机,负责管理数据和计算的拆分。主节点与集群中其余计算机(称为"工作节点"worker)相连。主节点将需要运行的数据和计算发送给工作节点,工作节点再将结果返回给主节点。

刚开始使用 Spark 时,本地运行一个集群会更简单。因此,在本课程中,所有计算都会在 DataCamp 的服务器上以模拟集群的方式运行,而不是连接到另一台计算机。

创建连接只需实例化 SparkContext 类即可。该类的构造函数接受一些可选参数,用于指定要连接的集群属性。

可以使用 SparkConf() 构造函数创建一个包含所有这些属性的对象。详细信息请参阅文档

在本课程的其余部分,您的工作空间中会预先提供一个名为 scSparkContext

如何通过 PySpark 连接到 Spark 集群?

本练习是课程的一部分

PySpark 基础

查看课程

动手互动练习

通过我们的互动练习之一,将理论转化为实践

开始练习