开始使用免费开始使用

连接—工作—断开 的模式

当数据存放在数据库中时,使用 sparklyr 的方式与使用 dplyr 十分类似。事实上,sparklyr 会先把您的 R 代码转换为 SQL,再传给 Spark 执行。

典型的工作流程包括 3 个步骤:

  1. 使用 spark_connect() 连接到 Spark。
  2. 执行一些操作。
  3. 使用 spark_disconnect() 关闭与 Spark 的连接。

在本练习中,您将完成最简单的一步工作:使用 spark_version() 返回正在运行的 Spark 版本。

spark_connect() 需要一个指向 Spark 位置的 URL。对于本地集群(就像您现在运行的环境),URL 应为 "local"。对于远程集群(在另一台机器上,通常是高性能服务器),连接字符串将是包含主机与端口的 URL。

spark_version()spark_disconnect() 都以 Spark 连接对象作为唯一参数。

需要提醒的是:连接到集群需要几秒钟,因此频繁连接与断开并不实际。在 DataCamp 的每个练习中,您需要重新连接;但在将 sparklyr 融入您自己的工作流程时,通常最好在与 Spark 交互的整个期间保持连接处于打开状态。

本练习是课程的一部分

R 中使用 sparklyr 的 Spark 入门

查看课程

练习说明

  • 使用 library() 加载 sparklyr 包。
  • 调用 spark_connect() 连接到 Spark,参数为 master = "local",并将结果赋给 spark_conn
  • 使用 spark_version() 获取 Spark 版本,参数为 sc = spark_conn
  • 使用 spark_disconnect() 断开与 Spark 的连接,参数为 sc = spark_conn

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load sparklyr
___

# Connect to your Spark cluster
spark_conn <- ___

# Print the version of Spark
___

# Disconnect from Spark
___
编辑并运行代码