Agregace v RDD
Teď, když jsi pracoval/a s analýzou dat pomocí DataFrames v PySparku, zkusíme podobný úkol s RDD. Pomocí připraveného kódu zjisti součet hodnot RDD v PySparku.
Spark session s názvem spark je již připravena.
Toto cvičení je součástí kurzu
Introduction to PySpark
Pokyny k cvičení
- Vytvoř RDD z připraveného DataFrame.
- Aplikuj připravenou Lambda funkci na klíče RDD.
- Získej výsledky agregace pomocí collect.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)
# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))
# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)
# Show the collected Results
print(rdd_aggregated.____())