Seskupování dat v pandas
Výstupem datového pipeline je zpravidla „modelovaná" datová sada. Ta umožňuje spotřebitelům dat snadný přístup k informacím bez nutnosti složitých úprav. Seskupování dat pomocí pandas pomáhá takovéto modelované datové sady vytvářet.
pandas je naimportován jako pd a DataFrame raw_testing_scores obsahuje data v následující podobě:
street_address city math_score reading_score writing_score
01M539 111 Columbia Street Manhattan 657.0 601.0 601.0
02M294 350 Grand Street Manhattan 395.0 411.0 387.0
02M308 350 Grand Street Manhattan 418.0 428.0 415.0
Toto cvičení je součástí kurzu
ETL a ELT v Pythonu
Pokyny k cvičení
- Pomocí
.loc[]ponech v DataFrame pouze sloupce"city","math_score","reading_score"a"writing_score". - Seskup DataFrame podle sloupce
"city"a zjisti průměr matematického, čtenářského a písemného skóre pro každé město. - Pomocí funkce
transform()vytvoř seskupený DataFrame.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def transform(raw_data):
# Use .loc[] to only return the needed columns
raw_data = raw_data.____[:, ____]
# Group the data by city, return the grouped DataFrame
grouped_data = raw_data.____(by=["____"], axis=0).____()
return grouped_data
# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())