從外部資料集建立 RDD
PySpark 可以很容易地從外部儲存裝置中的檔案建立 RDD,例如 HDFS(Hadoop 分散式檔案系統)、Amazon S3 bucket 等。不過,最常見的方式還是從本機檔案系統的檔案建立 RDD。這種方法會接受檔案路徑,並將其讀取為一行一行的集合。在本練習中,你將從檔案路徑(file_path)建立一個 RDD,檔名為已在你的工作環境中可用的 README.md。
請記住,你的工作環境中已經有一個 SparkContext sc 可用。
本練習屬於課程
使用 PySpark 的 Big Data 基礎
練習說明
- 在 PySpark 命令列列印
file_path。 - 以
file_path建立一個名為fileRDD的 RDD。 - 列印所建立
fileRDD的型別。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))