連線-工作-中斷:典型流程
使用 sparklyr 的方式,和在資料庫中用 dplyr 操作資料很像。事實上,sparklyr 會先把你的 R 程式碼轉成 SQL,再交給 Spark 執行。
典型的工作流程有三個步驟:
- 使用
spark_connect()連線到 Spark。 - 進行需要的操作。
- 使用
spark_disconnect()關閉與 Spark 的連線。
在這個練習中,你會做最簡單的一件事:使用 spark_version() 回傳目前執行中的 Spark 版本。
spark_connect() 的參數需要提供 Spark 的位置 URL。對於本機叢集(就像你現在執行的),URL 應該是 "local"。對於遠端叢集(在另一台機器上,通常是高效能伺服器),連線字串會是包含主機與連接埠的 URL。
spark_version() 和 spark_disconnect() 都只需要一個參數:Spark 連線物件。
提醒一點:連線到叢集需要花上數秒,因此不適合頻繁連線與中斷。在 DataCamp 的每個練習中你需要重新連線,不過在你自己的工作流程中使用 sparklyr 時,通常最好在整個與 Spark 互動的期間都維持連線開啟。
本練習屬於課程
使用 R 的 sparklyr:Spark 入門
練習說明
- 使用
library()載入sparklyr套件。 - 呼叫
spark_connect()連線到 Spark,參數為master = "local",並將結果指定給spark_conn。 - 使用
spark_version()取得 Spark 版本,參數為sc = spark_conn。 - 使用
spark_disconnect()中斷與 Spark 的連線,參數為sc = spark_conn。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___