Зчитування CSV і виконання агрегацій
У вас є електронна таблиця з інформацією про зарплати Data Scientist у компаніях різного розміру — від малих до великих. Ви хочете перевірити, чи є суттєва різниця між середніми зарплатами залежно від розміру компанії.
Пам'ятайте: у вашому робочому середовищі вже є SparkSession з назвою spark!
Ця вправа є частиною курсу
Вступ до PySpark
Інструкції до вправи
- Завантажте файл CSV як датафрейм і визначте схему автоматично.
- Поверніть кількість рядків.
- Згрупуйте за стовпцем
company_sizeі обчисліть середню зарплату заsalary_in_usd.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()