开始使用免费开始使用

创建 SparkSession

在本练习中,您将使用所有可用的核心启动一个本地 Spark 集群。该集群将通过一个 SparkSession 对象进行访问。

SparkSession 类有一个 builder 属性,它是 Builder 类的实例。Builder 类提供了三个重要方法,可用于:

  • 指定主节点的位置;
  • 命名应用程序(可选);以及
  • 获取现有的 SparkSession,如果不存在则创建一个新的。

SparkSession 类有一个 version 属性,可返回 Spark 的版本。注意: 也可以通过 pyspark 模块上的 __version__ 属性访问版本。

在此处查看更多关于 SparkSession 的信息:here

完成使用该集群后,请将其关闭,以便释放资源,使其可供其他进程使用。

说明:

  1. 您可以在 IPython Shell 旁的 Slides 面板中回顾课件中的幻灯片。
  2. 练习中使用的 Spark 版本与课程讲解中的版本并不相同。练习平台已更新为更高版本的 Spark。

本练习是课程的一部分

使用 PySpark 进行机器学习

查看课程

练习说明

  • pyspark.sql 导入 SparkSession 类。
  • 创建一个连接到本地集群的 SparkSession 对象。使用所有可用核心。将应用程序命名为 'test'
  • 使用 SparkSession 对象的 version 属性获取集群上运行的 Spark 版本。注意: 该版本可能与演示中使用的版本不同(平台会不时更新)。
  • 关闭集群。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the SparkSession class
from ____ import ____

# Create SparkSession object
spark = SparkSession.builder \
                    .master(____) \
                    .____(____) \
                    .____()

# What version of Spark?
print(spark.____)

# Terminate the cluster
spark.____()
编辑并运行代码