開始使用免費開始

在 PySpark shell 載入資料

在 PySpark 中,我們透過對分散式集合執行運算來表達計算,這些集合會自動在叢集中平行化。前一個練習中,你已經看過如何將清單載入為平行化的集合;在這個練習裡,你要在 PySpark shell 內,從本機檔案載入資料。

請記住,你的工作區已經有 SparkContext sc 和變數 file_path(指向 README.md 檔案的路徑)可用。

本練習屬於課程

使用 PySpark 的 Big Data 基礎

檢視課程

練習說明

  • 在 PySpark shell 載入本機文字檔 README.md

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load a local file into PySpark shell
lines = sc.____(file_path)
編輯並執行程式碼