开始使用免费开始使用

筛选与计数

RDD 变换 filter() 会返回一个新的 RDD,只包含满足特定函数条件的元素。它常用于基于关键字筛选大型数据集。本练习中,您将从由 README.md 文件文本行组成的 fileRDD 中,筛选出包含关键字 Spark 的行。接着,统计包含关键字 Spark 的行总数,最后打印筛选后 RDD 的前 4 行。

请注意,您的工作区中已经提供了 SparkContext scfile_pathfileRDD

本练习是课程的一部分

使用 PySpark 的大数据基础

查看课程

练习说明

  • 使用 filter() 变换选择包含关键字 Spark 的行。
  • fileRDD_filter 中,有多少行包含关键字 Spark
  • 打印结果 RDD 的前 4 行。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
编辑并运行代码