Citirea unui fișier CSV și realizarea de agregări
Ai un tabel cu salariile unor specialiști în date din companii de diferite dimensiuni, de la mici la mari. Vrei să verifici dacă există diferențe semnificative între salariile medii grupate după dimensiunea companiei.
Reține că în workspace-ul tău există deja o SparkSession numită spark!
Acest exercițiu face parte din cursul
Introducere în PySpark
Instrucțiuni pentru exercițiu
- Încarcă un fișier CSV ca DataFrame și inferează schema.
- Returnează numărul de rânduri.
- Grupează după coloana
company_sizeși calculează salariul mediu folosindsalary_in_usd.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()