ÎncepețiÎncepe gratuit

Gruparea datelor cu pandas

Rezultatul unui pipeline de date este, de obicei, un set de date „modelat". Acesta oferă consumatorilor de date acces facil la informații, fără a fi nevoie de prea multe transformări suplimentare. Gruparea datelor cu pandas ajută la construirea unor astfel de seturi de date modelate.

pandas a fost importat ca pd, iar DataFrame-ul raw_testing_scores conține date în următoarea formă:

              street_address       city  math_score  reading_score  writing_score
01M539   111 Columbia Street  Manhattan       657.0          601.0          601.0
02M294      350 Grand Street  Manhattan       395.0          411.0          387.0
02M308      350 Grand Street  Manhattan       418.0          428.0          415.0

Acest exercițiu face parte din cursul

ETL și ELT în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește .loc[] pentru a păstra doar coloanele "city", "math_score", "reading_score" și "writing_score".
  • Grupează DataFrame-ul după coloana "city" și calculează media scorurilor la matematică, citire și scriere pentru fiecare oraș.
  • Folosește funcția transform() pentru a crea un DataFrame grupat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

def transform(raw_data):
	# Use .loc[] to only return the needed columns
	raw_data = raw_data.____[:, ____]
	
    # Group the data by city, return the grouped DataFrame
	grouped_data = raw_data.____(by=["____"], axis=0).____()
	return grouped_data

# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())
Editează și rulează codul