ПочатиПочніть безкоштовно

Фільтрація та підрахунок

Трансформація RDD filter() повертає новий RDD, що містить лише елементи, які задовольняють певну функцію. Це зручно для фільтрування великих наборів даних за ключовим словом. У цій вправі ви відфільтруєте рядки, що містять ключове слово Spark, з RDD fileRDD, який складається з рядків тексту з файла README.md. Далі ви порахуєте загальну кількість рядків, що містять ключове слово Spark, і, нарешті, виведете перші 4 рядки відфільтрованого RDD.

Пам'ятайте: у вашому середовищі вже доступні SparkContext sc, file_path і fileRDD.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Створіть трансформацію filter() для вибору рядків, що містять ключове слово Spark.
  • Скільки рядків у fileRDD_filter містять ключове слово Spark?
  • Виведіть перші чотири рядки отриманого RDD.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
Редагувати та запускати код