Kom igångKom igång gratis

Läsa in en CSV-fil och utföra aggregeringar

Du har ett kalkylblad med löner för datavetare från företag av varierande storlek – från små till stora. Du vill undersöka om det finns en tydlig skillnad mellan genomsnittslönerna grupperade efter företagsstorlek.

Kom ihåg att det redan finns en SparkSession som heter spark i din arbetsmiljö!

Den här övningen är en del av kursen

Introduktion till PySpark

Visa kurs

Övningsinstruktioner

  • Läs in en CSV-fil som en DataFrame och härledd schemat automatiskt.
  • Returnera antalet rader.
  • Gruppera efter kolumnen company_size och beräkna genomsnittslönen med salary_in_usd.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
Redigera och kör kod