Bắt đầu ngayBắt đầu miễn phí

Gom nhóm dữ liệu với pandas

Đầu ra của một data pipeline thường là một bộ dữ liệu đã được "mô hình hóa". Bộ dữ liệu này giúp người dùng dữ liệu truy cập thông tin dễ dàng mà không cần thao tác quá nhiều. Gom nhóm dữ liệu với pandas giúp bạn xây dựng các bộ dữ liệu đã mô hình hóa.

pandas đã được import với tên pd, và DataFrame raw_testing_scores chứa dữ liệu dưới dạng sau:

              street_address       city  math_score  reading_score  writing_score
01M539   111 Columbia Street  Manhattan       657.0          601.0          601.0
02M294      350 Grand Street  Manhattan       395.0          411.0          387.0
02M308      350 Grand Street  Manhattan       418.0          428.0          415.0

Bài tập này là một phần của khóa học

ETL và ELT với Python

Xem khóa học

Hướng dẫn bài tập

  • Dùng .loc[] để chỉ giữ các cột "city", "math_score", "reading_score", và "writing_score".
  • Gom nhóm DataFrame theo cột "city", và tính giá trị trung bình điểm toán, đọc, và viết của mỗi thành phố.
  • Dùng hàm transform() để tạo một DataFrame đã được gom nhóm.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

def transform(raw_data):
	# Use .loc[] to only return the needed columns
	raw_data = raw_data.____[:, ____]
	
    # Group the data by city, return the grouped DataFrame
	grouped_data = raw_data.____(by=["____"], axis=0).____()
	return grouped_data

# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())
Chỉnh sửa và Chạy Mã