Zacznij terazZacznij za darmo

Agregacja w RDD

Skoro przeprowadziłeś już analizę z użyciem DataFrames w PySpark, czas na podobne zadanie z RDD. Korzystając z dostarczonego kodu, oblicz sumę wartości RDD w PySpark.

Sesja Spark o nazwie spark została już utworzona.

To ćwiczenie jest częścią kursu

Wprowadzenie do PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz RDD na podstawie dostarczonego DataFrame.
  • Zastosuj dostarczoną funkcję Lambda do kluczy RDD.
  • Zbierz wyniki agregacji.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)

# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))

# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)

# Show the collected Results
print(rdd_aggregated.____())
Edytuj i uruchom kod