開始使用免費開始

連線-工作-中斷:典型流程

使用 sparklyr 的方式,和在資料庫中用 dplyr 操作資料很像。事實上,sparklyr 會先把你的 R 程式碼轉成 SQL,再交給 Spark 執行。

典型的工作流程有三個步驟:

  1. 使用 spark_connect() 連線到 Spark。
  2. 進行需要的操作。
  3. 使用 spark_disconnect() 關閉與 Spark 的連線。

在這個練習中,你會做最簡單的一件事:使用 spark_version() 回傳目前執行中的 Spark 版本。

spark_connect() 的參數需要提供 Spark 的位置 URL。對於本機叢集(就像你現在執行的),URL 應該是 "local"。對於遠端叢集(在另一台機器上,通常是高效能伺服器),連線字串會是包含主機與連接埠的 URL。

spark_version()spark_disconnect() 都只需要一個參數:Spark 連線物件。

提醒一點:連線到叢集需要花上數秒,因此不適合頻繁連線與中斷。在 DataCamp 的每個練習中你需要重新連線,不過在你自己的工作流程中使用 sparklyr 時,通常最好在整個與 Spark 互動的期間都維持連線開啟。

本練習屬於課程

使用 R 的 sparklyr:Spark 入門

檢視課程

練習說明

  • 使用 library() 載入 sparklyr 套件。
  • 呼叫 spark_connect() 連線到 Spark,參數為 master = "local",並將結果指定給 spark_conn
  • 使用 spark_version() 取得 Spark 版本,參數為 sc = spark_conn
  • 使用 spark_disconnect() 中斷與 Spark 的連線,參數為 sc = spark_conn

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load sparklyr
___

# Connect to your Spark cluster
spark_conn <- ___

# Print the version of Spark
___

# Disconnect from Spark
___
編輯並執行程式碼