Map и Collect
Основной способ работы с данными в PySpark — это использование map(). Трансформация map() принимает функцию и применяет её к каждому элементу RDD. С её помощью можно решать самые разные задачи: например, получать веб-сайт по каждому URL из коллекции или просто возводить числа в степень. В этом упражнении вы примените трансформацию map(), чтобы возвести каждое число из RDD numbRDD, созданного ранее, в куб. Затем вы сохраните все элементы в переменную и выведете результат на экран.
Напомним: SparkContext sc и numbRDD уже доступны в вашем рабочем пространстве.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Создайте трансформацию
map(), которая возводит в куб все числа изnumbRDD. - Сохраните результаты в переменную
numbers_all. - Выведите содержимое переменной
numbers_allна экран.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)