Map і Collect
Головний спосіб обробляти дані в PySpark — це трансформація map(). Трансформація map() приймає функцію й застосовує її до кожного елемента RDD. Її можна використати для найрізноманітніших задач: від отримання вебсайту за кожним URL у колекції до піднесення чисел до квадрата. У цій простій вправі ви застосуєте map(), щоб піднести до куба кожне число в RDD numbRDD, який ви створили раніше. Потім ви збережете всі елементи у змінній і, нарешті, виведете результат.
Пам'ятайте, у вашому середовищі вже доступні SparkContext sc і numbRDD.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Створіть трансформацію
map(), яка підносить до куба всі числа вnumbRDD. - Зберіть результати у змінну
numbers_all. - Виведіть результат зі змінної
numbers_all.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)