Wczytywanie pliku CSV i wykonywanie agregacji
Masz arkusz kalkulacyjny z danymi o wynagrodzeniach Data Scientistów z firm różnej wielkości – od małych po duże. Chcesz sprawdzić, czy średnie wynagrodzenia różnią się znacząco w zależności od rozmiaru firmy.
Pamiętaj – w twoim środowisku pracy dostępna jest już sesja SparkSession o nazwie spark!
To ćwiczenie jest częścią kursu
Wprowadzenie do PySpark
Instrukcje do ćwiczenia
- Wczytaj plik CSV jako DataFrame i pozwól Sparkowi automatycznie wywnioskować schemat.
- Zwróć liczbę wierszy w zbiorze danych.
- Pogrupuj dane według kolumny
company_sizei oblicz średnie wynagrodzenie na podstawie kolumnysalary_in_usd.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()