Групування даних у pandas
Вихід даного пайплайну зазвичай — це «модельований» набір даних. Такий набір дає споживачам даних зручний доступ до інформації без необхідності виконувати багато перетворень. Групування даних у pandas допомагає будувати модельовані набори даних.
pandas імпортовано як pd, а датафрейм raw_testing_scores містить дані у такому вигляді:
street_address city math_score reading_score writing_score
01M539 111 Columbia Street Manhattan 657.0 601.0 601.0
02M294 350 Grand Street Manhattan 395.0 411.0 387.0
02M308 350 Grand Street Manhattan 418.0 428.0 415.0
Ця вправа є частиною курсу
ETL та ELT у Python
Інструкції до вправи
- Використайте
.loc[], щоб залишити лише стовпці"city","math_score","reading_score"і"writing_score". - Згрупуйте датафрейм за стовпцем
"city"і знайдіть середнє значення балів з математики, читання та письма для кожного міста. - Використайте функцію
transform(), щоб створити згрупований датафрейм.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
def transform(raw_data):
# Use .loc[] to only return the needed columns
raw_data = raw_data.____[:, ____]
# Group the data by city, return the grouped DataFrame
grouped_data = raw_data.____(by=["____"], axis=0).____()
return grouped_data
# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())