筛选与计数
RDD 变换 filter() 会返回一个新的 RDD,只包含满足特定函数条件的元素。它常用于基于关键字筛选大型数据集。本练习中,您将从由 README.md 文件文本行组成的 fileRDD 中,筛选出包含关键字 Spark 的行。接着,统计包含关键字 Spark 的行总数,最后打印筛选后 RDD 的前 4 行。
请注意,您的工作区中已经提供了 SparkContext sc、file_path 和 fileRDD。
本练习是课程的一部分
使用 PySpark 的大数据基础
练习说明
- 使用
filter()变换选择包含关键字Spark的行。 - 在
fileRDD_filter中,有多少行包含关键字Spark? - 打印结果 RDD 的前 4 行。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)