НачатьНачать бесплатно

Сбор данных из RDD

В этом упражнении вы поработаете как с RDD, так и с DataFrame в PySpark. Цель — сгруппировать данные и выполнить агрегацию с помощью операций RDD и методов DataFrame.

Вы загрузите CSV-файл с данными о зарплатах сотрудников в PySpark в виде RDD. Затем сгруппируете данные по уровню опыта и вычислите максимальную зарплату для каждого уровня на основе DataFrame. Это позволит вам наглядно увидеть сильные стороны обоих форматов.

Используемый набор данных содержит информацию о зарплатах специалистов по данным, поэтому анализ рыночных тенденций будет весьма полезен! Данные уже загружены и нормализованы. Помните, что в вашем рабочем пространстве уже создана SparkSession с именем spark!

Это упражнение является частью курса

Введение в PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте RDD из DataFrame.
  • Соберите и отобразите результаты RDD и DataFrame.
  • Сгруппируйте данные по столбцу "experience_level" и вычислите максимальную зарплату для каждого уровня опыта.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____

# Collect and print the results
print(rdd_salaries.____)

# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})

# Show the results
dataframe_results.____
Редактировать и запускать код