Группировка данных с помощью pandas
Результатом работы конвейера данных, как правило, является «смоделированный» набор данных. Он предоставляет потребителям данных удобный доступ к информации без необходимости выполнять сложные преобразования. Группировка данных с помощью pandas помогает формировать такие наборы данных.
pandas импортирован как pd, а DataFrame raw_testing_scores содержит данные следующего вида:
street_address city math_score reading_score writing_score
01M539 111 Columbia Street Manhattan 657.0 601.0 601.0
02M294 350 Grand Street Manhattan 395.0 411.0 387.0
02M308 350 Grand Street Manhattan 418.0 428.0 415.0
Это упражнение является частью курса
ETL и ELT на Python
Инструкции к упражнению
- С помощью
.loc[]оставьте только столбцы"city","math_score","reading_score"и"writing_score". - Сгруппируйте DataFrame по столбцу
"city"и вычислите среднее значение баллов по математике, чтению и письму для каждого города. - Используйте функцию
transform(), чтобы создать сгруппированный DataFrame.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
def transform(raw_data):
# Use .loc[] to only return the needed columns
raw_data = raw_data.____[:, ____]
# Group the data by city, return the grouped DataFrame
grouped_data = raw_data.____(by=["____"], axis=0).____()
return grouped_data
# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())