Gruparea datelor cu pandas
Rezultatul unui pipeline de date este, de obicei, un set de date „modelat". Acesta oferă consumatorilor de date acces facil la informații, fără a fi nevoie de prea multe transformări suplimentare. Gruparea datelor cu pandas ajută la construirea unor astfel de seturi de date modelate.
pandas a fost importat ca pd, iar DataFrame-ul raw_testing_scores conține date în următoarea formă:
street_address city math_score reading_score writing_score
01M539 111 Columbia Street Manhattan 657.0 601.0 601.0
02M294 350 Grand Street Manhattan 395.0 411.0 387.0
02M308 350 Grand Street Manhattan 418.0 428.0 415.0
Acest exercițiu face parte din cursul
ETL și ELT în Python
Instrucțiuni pentru exercițiu
- Folosește
.loc[]pentru a păstra doar coloanele"city","math_score","reading_score"și"writing_score". - Grupează DataFrame-ul după coloana
"city"și calculează media scorurilor la matematică, citire și scriere pentru fiecare oraș. - Folosește funcția
transform()pentru a crea un DataFrame grupat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
def transform(raw_data):
# Use .loc[] to only return the needed columns
raw_data = raw_data.____[:, ____]
# Group the data by city, return the grouped DataFrame
grouped_data = raw_data.____(by=["____"], axis=0).____()
return grouped_data
# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())