连接—工作—断开 的模式
当数据存放在数据库中时,使用 sparklyr 的方式与使用 dplyr 十分类似。事实上,sparklyr 会先把您的 R 代码转换为 SQL,再传给 Spark 执行。
典型的工作流程包括 3 个步骤:
- 使用
spark_connect()连接到 Spark。 - 执行一些操作。
- 使用
spark_disconnect()关闭与 Spark 的连接。
在本练习中,您将完成最简单的一步工作:使用 spark_version() 返回正在运行的 Spark 版本。
spark_connect() 需要一个指向 Spark 位置的 URL。对于本地集群(就像您现在运行的环境),URL 应为 "local"。对于远程集群(在另一台机器上,通常是高性能服务器),连接字符串将是包含主机与端口的 URL。
spark_version() 和 spark_disconnect() 都以 Spark 连接对象作为唯一参数。
需要提醒的是:连接到集群需要几秒钟,因此频繁连接与断开并不实际。在 DataCamp 的每个练习中,您需要重新连接;但在将 sparklyr 融入您自己的工作流程时,通常最好在与 Spark 交互的整个期间保持连接处于打开状态。
本练习是课程的一部分
R 中使用 sparklyr 的 Spark 入门
练习说明
- 使用
library()加载sparklyr包。 - 调用
spark_connect()连接到 Spark,参数为master = "local",并将结果赋给spark_conn。 - 使用
spark_version()获取 Spark 版本,参数为sc = spark_conn。 - 使用
spark_disconnect()断开与 Spark 的连接,参数为sc = spark_conn。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___