ПочатиПочніть безкоштовно

Групування даних у pandas

Вихід даного пайплайну зазвичай — це «модельований» набір даних. Такий набір дає споживачам даних зручний доступ до інформації без необхідності виконувати багато перетворень. Групування даних у pandas допомагає будувати модельовані набори даних.

pandas імпортовано як pd, а датафрейм raw_testing_scores містить дані у такому вигляді:

              street_address       city  math_score  reading_score  writing_score
01M539   111 Columbia Street  Manhattan       657.0          601.0          601.0
02M294      350 Grand Street  Manhattan       395.0          411.0          387.0
02M308      350 Grand Street  Manhattan       418.0          428.0          415.0

Ця вправа є частиною курсу

ETL та ELT у Python

Переглянути курс

Інструкції до вправи

  • Використайте .loc[], щоб залишити лише стовпці "city", "math_score", "reading_score" і "writing_score".
  • Згрупуйте датафрейм за стовпцем "city" і знайдіть середнє значення балів з математики, читання та письма для кожного міста.
  • Використайте функцію transform(), щоб створити згрупований датафрейм.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

def transform(raw_data):
	# Use .loc[] to only return the needed columns
	raw_data = raw_data.____[:, ____]
	
    # Group the data by city, return the grouped DataFrame
	grouped_data = raw_data.____(by=["____"], axis=0).____()
	return grouped_data

# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())
Редагувати та запускати код