ПочатиПочніть безкоштовно

Збирання RDD

У цій вправі ви попрацюєте і з RDD, і з датафреймами в PySpark. Мета — згрупувати дані та виконати агрегацію як за допомогою операцій RDD, так і методів DataFrame.

Ви завантажите CSV‑файл із даними про зарплати співробітників у PySpark як RDD. Потім згрупуєте за рівнем досвіду та обчислите максимальну зарплату для кожного рівня досвіду з датафрейму. Так ви побачите відносні переваги обох форматів даних.

Набір даних стосується зарплат Data Scientist, тож знаходити ринкові тренди — у ваших інтересах! Ми вже завантажили й нормалізували дані для вас. Пам'ятайте, у вашому робочому середовищі вже є SparkSession під назвою spark!

Ця вправа є частиною курсу

Вступ до PySpark

Переглянути курс

Інструкції до вправи

  • Створіть RDD з датафрейму.
  • Зберіть і відобразіть результати для RDD і DataFrame.
  • Згрупуйте за "experience_level" і обчисліть максимальну зарплату для кожного рівня.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____

# Collect and print the results
print(rdd_salaries.____)

# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})

# Show the results
dataframe_results.____
Редагувати та запускати код