Kom igångKom igång gratis

Aggregering i RDD:er

Nu när du har utfört analyser med DataFrames i PySpark är det dags att göra något liknande med en RDD. Använd den befintliga koden för att beräkna summan av värdena i en RDD i PySpark.

En Spark-session med namnet spark har redan skapats åt dig.

Den här övningen är en del av kursen

Introduktion till PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en RDD från den befintliga DataFrame:n.
  • Tillämpa den angivna Lambda-funktionen på nycklarna i RDD:n.
  • Samla in resultatet av aggregeringen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)

# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))

# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)

# Show the collected Results
print(rdd_aggregated.____())
Redigera och kör kod