Map et Collect
La méthode principale pour manipuler des données en PySpark est map(). La transformation map() reçoit une fonction et l'applique à chaque élément du RDD. On peut l'utiliser pour une foule de tâches, que ce soit récupérer le site Web associé à chaque URL de notre ensemble ou simplement mettre au carré des nombres. Dans cet exercice simple, vous utiliserez la transformation map() pour mettre au cube chaque nombre du RDD numbRDD que vous avez créé plus tôt. Ensuite, vous stockerez tous les éléments dans une variable et, pour finir, vous afficherez le résultat.
N'oubliez pas : vous avez déjà un SparkContext sc, et numbRDD est disponible dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Créez une transformation
map()qui met au cube tous les nombres dansnumbRDD. - Rassemblez les résultats dans une variable
numbers_all. - Affichez le résultat à partir de la variable
numbers_all.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)