Kom igångKom igång gratis

GroupBy i PySpark

Du har sett hur man använder ramverket dask och dess DataFrame-abstraktion för att utföra beräkningar. Men som framgick i videon är Spark troligen ett mer populärt val för databearbetning i stordatavärlden.

I den här övningen använder du paketet PySpark för att hantera en Spark DataFrame. Datan är densamma som i tidigare övningar: deltagare i olympiska tävlingar mellan 1896 och 2016.

Spark DataFrame:en athlete_events_spark finns tillgänglig i din workspace.

Metoderna du kommer att använda i den här övningen är:

  • .printSchema(): skriver ut schemat för en Spark DataFrame.
  • .groupBy(): grupperingsuttryck för en aggregering.
  • .mean(): beräknar medelvärdet för varje grupp.
  • .show(): visar resultaten.

Den här övningen är en del av kursen

Introduktion till datatekniker

Visa kurs

Övningsinstruktioner

  • Ta reda på typen för athlete_events_spark.
  • Ta reda på schemat för athlete_events_spark.
  • Skriv ut medelåldern för olympiadeltagarna, grupperat efter år. Observera att Spark faktiskt inte har beräknat något ännu – det kallas för lazy evaluation.
  • Ta det föregående resultatet och anropa .show() på det för att beräkna medelåldern.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Print the type of athlete_events_spark
print(____(athlete_events_spark))

# Print the schema of athlete_events_spark
print(athlete_events_spark.____())

# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____))

# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____).____())
Redigera och kör kod