创建 SparkSession
在本练习中,您将使用所有可用的核心启动一个本地 Spark 集群。该集群将通过一个 SparkSession 对象进行访问。
SparkSession 类有一个 builder 属性,它是 Builder 类的实例。Builder 类提供了三个重要方法,可用于:
- 指定主节点的位置;
- 命名应用程序(可选);以及
- 获取现有的
SparkSession,如果不存在则创建一个新的。
SparkSession 类有一个 version 属性,可返回 Spark 的版本。注意: 也可以通过 pyspark 模块上的 __version__ 属性访问版本。
在此处查看更多关于 SparkSession 的信息:here。
完成使用该集群后,请将其关闭,以便释放资源,使其可供其他进程使用。
说明:
- 您可以在 IPython Shell 旁的 Slides 面板中回顾课件中的幻灯片。
- 练习中使用的 Spark 版本与课程讲解中的版本并不相同。练习平台已更新为更高版本的 Spark。
本练习是课程的一部分
使用 PySpark 进行机器学习
练习说明
- 从
pyspark.sql导入SparkSession类。 - 创建一个连接到本地集群的
SparkSession对象。使用所有可用核心。将应用程序命名为'test'。 - 使用
SparkSession对象的version属性获取集群上运行的 Spark 版本。注意: 该版本可能与演示中使用的版本不同(平台会不时更新)。 - 关闭集群。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the SparkSession class
from ____ import ____
# Create SparkSession object
spark = SparkSession.builder \
.master(____) \
.____(____) \
.____()
# What version of Spark?
print(spark.____)
# Terminate the cluster
spark.____()