GroupBy i PySpark
Du har sett hur man använder ramverket dask och dess DataFrame-abstraktion för att utföra beräkningar. Men som framgick i videon är Spark troligen ett mer populärt val för databearbetning i stordatavärlden.
I den här övningen använder du paketet PySpark för att hantera en Spark DataFrame. Datan är densamma som i tidigare övningar: deltagare i olympiska tävlingar mellan 1896 och 2016.
Spark DataFrame:en athlete_events_spark finns tillgänglig i din workspace.
Metoderna du kommer att använda i den här övningen är:
.printSchema(): skriver ut schemat för en Spark DataFrame..groupBy(): grupperingsuttryck för en aggregering..mean(): beräknar medelvärdet för varje grupp..show(): visar resultaten.
Den här övningen är en del av kursen
Introduktion till datatekniker
Övningsinstruktioner
- Ta reda på typen för
athlete_events_spark. - Ta reda på schemat för
athlete_events_spark. - Skriv ut medelåldern för olympiadeltagarna, grupperat efter år. Observera att Spark faktiskt inte har beräknat något ännu – det kallas för lazy evaluation.
- Ta det föregående resultatet och anropa
.show()på det för att beräkna medelåldern.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print the type of athlete_events_spark
print(____(athlete_events_spark))
# Print the schema of athlete_events_spark
print(athlete_events_spark.____())
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____))
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____).____())