GroupBy în PySpark
Ai văzut cum se folosește framework-ul dask și abstracțiunea sa DataFrame pentru a efectua calcule. Totuși, după cum ai observat în videoclip, în lumea big data, Spark este probabil cea mai populară alegere pentru procesarea datelor.
În acest exercițiu, vei folosi pachetul PySpark pentru a lucra cu un Spark DataFrame. Datele sunt aceleași ca în exercițiile anterioare: participanți la evenimente olimpice între 1896 și 2016.
Spark DataFrame-ul athlete_events_spark este disponibil în spațiul tău de lucru.
Metodele pe care le vei folosi în acest exercițiu sunt:
.printSchema(): afișează schema unui Spark DataFrame..groupBy(): instrucțiune de grupare pentru o agregare..mean(): calculează media pentru fiecare grup..show(): afișează rezultatele.
Acest exercițiu face parte din cursul
Introducere în Data Engineering
Instrucțiuni pentru exercițiu
- Află tipul variabilei
athlete_events_spark. - Află schema variabilei
athlete_events_spark. - Afișează vârsta medie a olimpicilor, grupată după an. Observă că Spark nu a calculat nimic încă. Acest comportament se numește evaluare leneșă (lazy evaluation).
- Preia rezultatul anterior și apelează
.show()pe acesta pentru a calcula vârsta medie.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Print the type of athlete_events_spark
print(____(athlete_events_spark))
# Print the schema of athlete_events_spark
print(athlete_events_spark.____())
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____))
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____).____())