НачатьНачать бесплатно

Агрегация в RDD

Теперь, когда вы поработали с аналитикой на основе DataFrames в PySpark, давайте выполним похожую задачу с использованием RDD. С помощью приведённого кода вычислите сумму значений RDD в PySpark.

Сессия Spark с именем spark уже создана для вас.

Это упражнение является частью курса

Введение в PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте RDD из предоставленного DataFrame.
  • Примените указанную лямбда-функцию к ключам RDD.
  • Соберите результаты агрегации.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)

# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))

# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)

# Show the collected Results
print(rdd_aggregated.____())
Редактировать и запускать код