在 PySpark shell 載入資料
在 PySpark 中,我們透過對分散式集合執行運算來表達計算,這些集合會自動在叢集中平行化。前一個練習中,你已經看過如何將清單載入為平行化的集合;在這個練習裡,你要在 PySpark shell 內,從本機檔案載入資料。
請記住,你的工作區已經有 SparkContext sc 和變數 file_path(指向 README.md 檔案的路徑)可用。
本練習屬於課程
使用 PySpark 的 Big Data 基礎
練習說明
- 在 PySpark shell 載入本機文字檔
README.md。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Load a local file into PySpark shell
lines = sc.____(file_path)