НачатьНачать бесплатно

Map и Collect

Основной способ работы с данными в PySpark — это использование map(). Трансформация map() принимает функцию и применяет её к каждому элементу RDD. С её помощью можно решать самые разные задачи: например, получать веб-сайт по каждому URL из коллекции или просто возводить числа в степень. В этом упражнении вы примените трансформацию map(), чтобы возвести каждое число из RDD numbRDD, созданного ранее, в куб. Затем вы сохраните все элементы в переменную и выведете результат на экран.

Напомним: SparkContext sc и numbRDD уже доступны в вашем рабочем пространстве.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте трансформацию map(), которая возводит в куб все числа из numbRDD.
  • Сохраните результаты в переменную numbers_all.
  • Выведите содержимое переменной numbers_all на экран.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)

# Collect the results
numbers_all = cubedRDD.____()

# Print the numbers from numbers_all
for numb in ____:
	print(____)
Редактировать и запускать код