ПочатиПочніть безкоштовно

Зчитування CSV і виконання агрегацій

У вас є електронна таблиця з інформацією про зарплати Data Scientist у компаніях різного розміру — від малих до великих. Ви хочете перевірити, чи є суттєва різниця між середніми зарплатами залежно від розміру компанії.

Пам'ятайте: у вашому робочому середовищі вже є SparkSession з назвою spark!

Ця вправа є частиною курсу

Вступ до PySpark

Переглянути курс

Інструкції до вправи

  • Завантажте файл CSV як датафрейм і визначте схему автоматично.
  • Поверніть кількість рядків.
  • Згрупуйте за стовпцем company_size і обчисліть середню зарплату за salary_in_usd.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
Редагувати та запускати код