Kom igångKom igång gratis

Gruppera data med pandas

Resultatet av en datapipeline är vanligtvis en "modellerad" datamängd. Den ger datakonsumenter enkel tillgång till information utan att behöva utföra mycket bearbetning. Att gruppera data med pandas hjälper till att bygga sådana modellerade datamängder.

pandas har importerats som pd, och DataFrame:n raw_testing_scores innehåller data i följande format:

              street_address       city  math_score  reading_score  writing_score
01M539   111 Columbia Street  Manhattan       657.0          601.0          601.0
02M294      350 Grand Street  Manhattan       395.0          411.0          387.0
02M308      350 Grand Street  Manhattan       418.0          428.0          415.0

Den här övningen är en del av kursen

ETL och ELT i Python

Visa kurs

Övningsinstruktioner

  • Använd .loc[] för att bara behålla kolumnerna "city", "math_score", "reading_score" och "writing_score".
  • Gruppera DataFrame:n efter kolumnen "city" och beräkna medelvärdet för varje stads matematik-, läs- och skrivpoäng.
  • Använd funktionen transform() för att skapa en grupperad DataFrame.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

def transform(raw_data):
	# Use .loc[] to only return the needed columns
	raw_data = raw_data.____[:, ____]
	
    # Group the data by city, return the grouped DataFrame
	grouped_data = raw_data.____(by=["____"], axis=0).____()
	return grouped_data

# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())
Redigera och kör kod