НачатьНачать бесплатно

Чтение CSV-файла и выполнение агрегаций

У вас есть таблица с данными о зарплатах специалистов по данным из компаний разного размера — от малых до крупных. Вы хотите выяснить, есть ли существенная разница между средними зарплатами в зависимости от размера компании.

Напомним, что в вашем рабочем пространстве уже создан объект SparkSession с именем spark!

Это упражнение является частью курса

Введение в PySpark

Посмотреть курс

Инструкции к упражнению

  • Загрузите CSV-файл как DataFrame с автоматическим определением схемы.
  • Получите количество строк в DataFrame.
  • Сгруппируйте данные по столбцу company_size и вычислите среднюю зарплату по столбцу salary_in_usd.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
Редактировать и запускать код