ÎncepețiÎncepe gratuit

Citirea unui fișier CSV și realizarea de agregări

Ai un tabel cu salariile unor specialiști în date din companii de diferite dimensiuni, de la mici la mari. Vrei să verifici dacă există diferențe semnificative între salariile medii grupate după dimensiunea companiei.

Reține că în workspace-ul tău există deja o SparkSession numită spark!

Acest exercițiu face parte din cursul

Introducere în PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă un fișier CSV ca DataFrame și inferează schema.
  • Returnează numărul de rânduri.
  • Grupează după coloana company_size și calculează salariul mediu folosind salary_in_usd.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
Editează și rulează codul