Gruppera data med pandas
Resultatet av en datapipeline är vanligtvis en "modellerad" datamängd. Den ger datakonsumenter enkel tillgång till information utan att behöva utföra mycket bearbetning. Att gruppera data med pandas hjälper till att bygga sådana modellerade datamängder.
pandas har importerats som pd, och DataFrame:n raw_testing_scores innehåller data i följande format:
street_address city math_score reading_score writing_score
01M539 111 Columbia Street Manhattan 657.0 601.0 601.0
02M294 350 Grand Street Manhattan 395.0 411.0 387.0
02M308 350 Grand Street Manhattan 418.0 428.0 415.0
Den här övningen är en del av kursen
ETL och ELT i Python
Övningsinstruktioner
- Använd
.loc[]för att bara behålla kolumnerna"city","math_score","reading_score"och"writing_score". - Gruppera DataFrame:n efter kolumnen
"city"och beräkna medelvärdet för varje stads matematik-, läs- och skrivpoäng. - Använd funktionen
transform()för att skapa en grupperad DataFrame.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
def transform(raw_data):
# Use .loc[] to only return the needed columns
raw_data = raw_data.____[:, ____]
# Group the data by city, return the grouped DataFrame
grouped_data = raw_data.____(by=["____"], axis=0).____()
return grouped_data
# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())