CommencezCommencez gratuitement

Map et Collect

La méthode principale pour manipuler des données en PySpark est map(). La transformation map() reçoit une fonction et l'applique à chaque élément du RDD. On peut l'utiliser pour une foule de tâches, que ce soit récupérer le site Web associé à chaque URL de notre ensemble ou simplement mettre au carré des nombres. Dans cet exercice simple, vous utiliserez la transformation map() pour mettre au cube chaque nombre du RDD numbRDD que vous avez créé plus tôt. Ensuite, vous stockerez tous les éléments dans une variable et, pour finir, vous afficherez le résultat.

N'oubliez pas : vous avez déjà un SparkContext sc, et numbRDD est disponible dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Créez une transformation map() qui met au cube tous les nombres dans numbRDD.
  • Rassemblez les résultats dans une variable numbers_all.
  • Affichez le résultat à partir de la variable numbers_all.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)

# Collect the results
numbers_all = cubedRDD.____()

# Print the numbers from numbers_all
for numb in ____:
	print(____)
Modifier et exécuter le code