Збирання RDD
У цій вправі ви попрацюєте і з RDD, і з датафреймами в PySpark. Мета — згрупувати дані та виконати агрегацію як за допомогою операцій RDD, так і методів DataFrame.
Ви завантажите CSV‑файл із даними про зарплати співробітників у PySpark як RDD. Потім згрупуєте за рівнем досвіду та обчислите максимальну зарплату для кожного рівня досвіду з датафрейму. Так ви побачите відносні переваги обох форматів даних.
Набір даних стосується зарплат Data Scientist, тож знаходити ринкові тренди — у ваших інтересах! Ми вже завантажили й нормалізували дані для вас. Пам'ятайте, у вашому робочому середовищі вже є SparkSession під назвою spark!
Ця вправа є частиною курсу
Вступ до PySpark
Інструкції до вправи
- Створіть RDD з датафрейму.
- Зберіть і відобразіть результати для RDD і DataFrame.
- Згрупуйте за
"experience_level"і обчисліть максимальну зарплату для кожного рівня.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____
# Collect and print the results
print(rdd_salaries.____)
# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})
# Show the results
dataframe_results.____