フィルターとカウント
RDD 変換の filter() は、指定した関数を満たす要素だけを含む新しい RDD を返します。これはキーワードに基づいて大規模データセットを抽出するのに便利です。この演習では、README.md ファイルのテキスト行から成る fileRDD RDD から、キーワード Spark を含む行だけを抽出します。次に、Spark を含む行の合計件数を数え、最後にフィルタ後の RDD の先頭 4 行を表示します。
ワークスペースには、すでに SparkContext sc、file_path、fileRDD が用意されています。
この演習はコースの一部です
PySparkで学ぶBig Data入門
演習の手順
- キーワード
Sparkを含む行を選択するように、filter()変換を作成してください。 fileRDD_filterにはSparkを含む行が何行ありますか?- 結果の RDD の先頭 4 行を表示してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)