在 Python 中使用 Spark
使用 Spark 的第一步是连接到一个集群。
在实际场景中,集群通常托管在一台远程机器上,并连接到其他所有节点。会有一台称为"主节点"(master)的计算机,负责管理数据和计算的拆分。主节点与集群中其余计算机(称为"工作节点"worker)相连。主节点将需要运行的数据和计算发送给工作节点,工作节点再将结果返回给主节点。
刚开始使用 Spark 时,本地运行一个集群会更简单。因此,在本课程中,所有计算都会在 DataCamp 的服务器上以模拟集群的方式运行,而不是连接到另一台计算机。
创建连接只需实例化 SparkContext 类即可。该类的构造函数接受一些可选参数,用于指定要连接的集群属性。
可以使用 SparkConf() 构造函数创建一个包含所有这些属性的对象。详细信息请参阅文档!
在本课程的其余部分,您的工作空间中会预先提供一个名为 sc 的 SparkContext。
如何通过 PySpark 连接到 Spark 集群?
本练习是课程的一部分
