Agregacje w PySpark
Czas na własne agregacje!
Skorzystasz ze zbioru danych o wynagrodzeniach, którego już używałeś(-aś). Sprawdź, jakie agregacje możesz utworzyć!
W przestrzeni roboczej masz już dostępną sesję SparkSession o nazwie spark oraz ramkę danych Spark salaries_df.
To ćwiczenie jest częścią kursu
Wprowadzenie do PySpark
Instrukcje do ćwiczenia
- Znajdź minimalne wynagrodzenie w małej firmie (Small) w USA – filtrując dane przez bezpośrednie odwołanie do kolumny (
"salary_in_usd"), a nie przez przekazanie ciągu SQL. - Znajdź maksymalne wynagrodzenie w dużej firmie (Large) w USA, oznaczonej jako
"L"– filtrując dane przez bezpośrednie odwołanie do kolumny ("salary_in_usd"), a nie przez przekazanie ciągu SQL.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()