CommencezCommencez gratuitement

Agrégation dans les RDD

Maintenant que vous avez réalisé des analyses avec des DataFrames dans PySpark, faisons brièvement une tâche similaire avec un RDD. À l'aide du code fourni, obtenez la somme des valeurs d'un RDD dans PySpark.

Une session Spark nommée spark a déjà été créée pour vous.

Cette activité fait partie du cours

Introduction à PySpark

Voir le cours

Instructions de l’exercice

  • Créez un RDD à partir du DataFrame fourni.
  • Appliquez la fonction Lambda fournie aux clés du RDD.
  • Récupérez les résultats de l'agrégation.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)

# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))

# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)

# Show the collected Results
print(rdd_aggregated.____())
Modifier et exécuter le code