開始使用免費開始

從外部資料集建立 RDD

PySpark 可以很容易地從外部儲存裝置中的檔案建立 RDD,例如 HDFS(Hadoop 分散式檔案系統)、Amazon S3 bucket 等。不過,最常見的方式還是從本機檔案系統的檔案建立 RDD。這種方法會接受檔案路徑,並將其讀取為一行一行的集合。在本練習中,你將從檔案路徑(file_path)建立一個 RDD,檔名為已在你的工作環境中可用的 README.md

請記住,你的工作環境中已經有一個 SparkContext sc 可用。

本練習屬於課程

使用 PySpark 的 Big Data 基礎

檢視課程

練習說明

  • 在 PySpark 命令列列印 file_path
  • file_path 建立一個名為 fileRDD 的 RDD。
  • 列印所建立 fileRDD 的型別。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
編輯並執行程式碼