Aggregering i PySpark
Nu är det dags att prova på aggregering på egen hand!
Du ska arbeta med ett löne-dataset som du redan känner till. Låt oss se vilka aggregeringar du kan skapa!
En SparkSession kallad spark finns redan i din miljö, tillsammans med Spark DataFrame:en salaries_df.
Den här övningen är en del av kursen
Introduktion till PySpark
Övningsinstruktioner
- Ta fram minimilönen för ett litet företag i USA – utför filtreringen genom att referera till kolumnen direkt (
"salary_in_usd"), inte genom att skicka en SQL-sträng. - Ta fram maxlönen för ett stort företag i USA, betecknat med
"L"– utför filtreringen genom att referera till kolumnen direkt ("salary_in_usd"), inte genom att skicka en SQL-sträng.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()