Začněte nyníZačněte zdarma

Seskupování dat v pandas

Výstupem datového pipeline je zpravidla „modelovaná" datová sada. Ta umožňuje spotřebitelům dat snadný přístup k informacím bez nutnosti složitých úprav. Seskupování dat pomocí pandas pomáhá takovéto modelované datové sady vytvářet.

pandas je naimportován jako pd a DataFrame raw_testing_scores obsahuje data v následující podobě:

              street_address       city  math_score  reading_score  writing_score
01M539   111 Columbia Street  Manhattan       657.0          601.0          601.0
02M294      350 Grand Street  Manhattan       395.0          411.0          387.0
02M308      350 Grand Street  Manhattan       418.0          428.0          415.0

Toto cvičení je součástí kurzu

ETL a ELT v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Pomocí .loc[] ponech v DataFrame pouze sloupce "city", "math_score", "reading_score" a "writing_score".
  • Seskup DataFrame podle sloupce "city" a zjisti průměr matematického, čtenářského a písemného skóre pro každé město.
  • Pomocí funkce transform() vytvoř seskupený DataFrame.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

def transform(raw_data):
	# Use .loc[] to only return the needed columns
	raw_data = raw_data.____[:, ____]
	
    # Group the data by city, return the grouped DataFrame
	grouped_data = raw_data.____(by=["____"], axis=0).____()
	return grouped_data

# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())
Upravit a spustit kód