篩選與計數
RDD 的轉換 filter() 會回傳一個新的 RDD,只包含符合特定函式條件的元素。這對於依關鍵字篩選大型資料集很實用。在這個練習中,你要從包含 README.md 檔案文字各行的 fileRDD 中,篩選出含有關鍵字 Spark 的各行。接著,計算含有關鍵字 Spark 的總行數,最後印出篩選後 RDD 的前 4 行。
請記得,你的工作環境中已經有 SparkContext sc、file_path,以及 fileRDD 可供使用。
本練習屬於課程
使用 PySpark 的 Big Data 基礎
練習說明
- 建立
filter()轉換,選出包含關鍵字Spark的各行。 fileRDD_filter中有多少行包含關鍵字Spark?- 印出結果 RDD 的前 4 行。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)