Фильтрация и подсчёт
Трансформация RDD filter() возвращает новый RDD, содержащий только те элементы, которые удовлетворяют заданному условию. Это удобный инструмент для фильтрации больших наборов данных по ключевому слову. В этом упражнении вы отфильтруете строки, содержащие ключевое слово Spark, из RDD fileRDD, который состоит из строк текста файла README.md. Затем вы подсчитаете общее количество таких строк и выведете первые 4 строки отфильтрованного RDD.
Напомним, что в вашем рабочем пространстве уже доступны SparkContext sc, переменная file_path и RDD fileRDD.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Создайте трансформацию
filter(), чтобы выбрать строки, содержащие ключевое словоSpark. - Сколько строк в
fileRDD_filterсодержат ключевое словоSpark? - Выведите первые четыре строки полученного RDD.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)