Kom igångKom igång gratis

Aggregering i PySpark

Nu är det dags att prova på aggregering på egen hand! Du ska arbeta med ett löne-dataset som du redan känner till. Låt oss se vilka aggregeringar du kan skapa! En SparkSession kallad spark finns redan i din miljö, tillsammans med Spark DataFrame:en salaries_df.

Den här övningen är en del av kursen

Introduktion till PySpark

Visa kurs

Övningsinstruktioner

  • Ta fram minimilönen för ett litet företag i USA – utför filtreringen genom att referera till kolumnen direkt ("salary_in_usd"), inte genom att skicka en SQL-sträng.
  • Ta fram maxlönen för ett stort företag i USA, betecknat med "L" – utför filtreringen genom att referera till kolumnen direkt ("salary_in_usd"), inte genom att skicka en SQL-sträng.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()

# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()
Redigera och kör kod