НачатьНачать бесплатно

Фильтрация и подсчёт

Трансформация RDD filter() возвращает новый RDD, содержащий только те элементы, которые удовлетворяют заданному условию. Это удобный инструмент для фильтрации больших наборов данных по ключевому слову. В этом упражнении вы отфильтруете строки, содержащие ключевое слово Spark, из RDD fileRDD, который состоит из строк текста файла README.md. Затем вы подсчитаете общее количество таких строк и выведете первые 4 строки отфильтрованного RDD.

Напомним, что в вашем рабочем пространстве уже доступны SparkContext sc, переменная file_path и RDD fileRDD.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте трансформацию filter(), чтобы выбрать строки, содержащие ключевое слово Spark.
  • Сколько строк в fileRDD_filter содержат ключевое слово Spark?
  • Выведите первые четыре строки полученного RDD.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
Редактировать и запускать код