Läsa in en CSV-fil och utföra aggregeringar
Du har ett kalkylblad med löner för datavetare från företag av varierande storlek – från små till stora. Du vill undersöka om det finns en tydlig skillnad mellan genomsnittslönerna grupperade efter företagsstorlek.
Kom ihåg att det redan finns en SparkSession som heter spark i din arbetsmiljö!
Den här övningen är en del av kursen
Introduktion till PySpark
Övningsinstruktioner
- Läs in en CSV-fil som en DataFrame och härledd schemat automatiskt.
- Returnera antalet rader.
- Gruppera efter kolumnen
company_sizeoch beräkna genomsnittslönen medsalary_in_usd.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()