在 Python 中使用 Spark
使用 Spark 的第一步是連線到叢集。
在實務上,叢集通常架設在一臺連接其他所有節點的遠端機器上。會有一臺稱為「主節點(master)」的電腦,負責管理如何切分資料與運算。主節點會連到叢集裡其餘稱為「工作節點(worker)」的電腦。主節點把要執行的資料與計算傳給工作節點,工作節點再把結果傳回主節點。
剛開始學 Spark 時,在本機執行一個叢集會更單純。因此,在本課程中,你不需要連到其他電腦,所有計算都會在 DataCamp 的伺服器上以模擬叢集的方式執行。
建立連線其實就是建立一個 SparkContext 類別的實例。這個類別的建構子可以接受一些選用引數,讓你指定要連線之叢集的屬性。
你可以用 SparkConf() 建構子建立一個包含這些屬性的物件。想了解更多細節,請參考說明文件(https://spark.apache.org/docs/latest/)。
在本課程的其餘內容中,你的工作環境會預先提供名為 sc 的 SparkContext。
你要如何從 PySpark 連線到 Spark 叢集?
本練習屬於課程
