開始使用免費開始

篩選與計數

RDD 的轉換 filter() 會回傳一個新的 RDD,只包含符合特定函式條件的元素。這對於依關鍵字篩選大型資料集很實用。在這個練習中,你要從包含 README.md 檔案文字各行的 fileRDD 中,篩選出含有關鍵字 Spark 的各行。接著,計算含有關鍵字 Spark 的總行數,最後印出篩選後 RDD 的前 4 行。

請記得,你的工作環境中已經有 SparkContext scfile_path,以及 fileRDD 可供使用。

本練習屬於課程

使用 PySpark 的 Big Data 基礎

檢視課程

練習說明

  • 建立 filter() 轉換,選出包含關鍵字 Spark 的各行。
  • fileRDD_filter 中有多少行包含關鍵字 Spark
  • 印出結果 RDD 的前 4 行。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
編輯並執行程式碼