Сбор данных из RDD
В этом упражнении вы поработаете как с RDD, так и с DataFrame в PySpark. Цель — сгруппировать данные и выполнить агрегацию с помощью операций RDD и методов DataFrame.
Вы загрузите CSV-файл с данными о зарплатах сотрудников в PySpark в виде RDD. Затем сгруппируете данные по уровню опыта и вычислите максимальную зарплату для каждого уровня на основе DataFrame. Это позволит вам наглядно увидеть сильные стороны обоих форматов.
Используемый набор данных содержит информацию о зарплатах специалистов по данным, поэтому анализ рыночных тенденций будет весьма полезен! Данные уже загружены и нормализованы. Помните, что в вашем рабочем пространстве уже создана SparkSession с именем spark!
Это упражнение является частью курса
Введение в PySpark
Инструкции к упражнению
- Создайте RDD из DataFrame.
- Соберите и отобразите результаты RDD и DataFrame.
- Сгруппируйте данные по столбцу
"experience_level"и вычислите максимальную зарплату для каждого уровня опыта.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____
# Collect and print the results
print(rdd_salaries.____)
# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})
# Show the results
dataframe_results.____