始める無料で始める

フィルターとカウント

RDD 変換の filter() は、指定した関数を満たす要素だけを含む新しい RDD を返します。これはキーワードに基づいて大規模データセットを抽出するのに便利です。この演習では、README.md ファイルのテキスト行から成る fileRDD RDD から、キーワード Spark を含む行だけを抽出します。次に、Spark を含む行の合計件数を数え、最後にフィルタ後の RDD の先頭 4 行を表示します。

ワークスペースには、すでに SparkContext scfile_pathfileRDD が用意されています。

この演習はコースの一部です

PySparkで学ぶBig Data入門

コースを見る

演習の手順

  • キーワード Spark を含む行を選択するように、filter() 変換を作成してください。
  • fileRDD_filter には Spark を含む行が何行ありますか?
  • 結果の RDD の先頭 4 行を表示してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
コードを編集して実行