ПочатиПочніть безкоштовно

Агрегування в RDD

Тепер, коли ви виконали аналітику з датафреймами в PySpark, виконаймо подібне завдання з RDD. Використовуючи наданий код, отримайте суму значень RDD у PySpark.

Сеанс Spark під назвою spark уже створено для вас.

Ця вправа є частиною курсу

Вступ до PySpark

Переглянути курс

Інструкції до вправи

  • Створіть RDD з наданого датафрейму.
  • Застосуйте надану Lambda-функцію до ключів RDD.
  • Зберіть результати агрегування.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)

# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))

# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)

# Show the collected Results
print(rdd_aggregated.____())
Редагувати та запускати код