开始使用免费开始使用

使用 pandas 分组数据

数据管道的输出通常是"建模后"的数据集。该数据集能让数据消费者更容易获取信息,而无需进行大量处理。使用 pandas 对数据分组有助于构建这类建模数据集。

已将 pandaspd 导入,raw_testing_scores DataFrame 的数据形式如下:

              street_address       city  math_score  reading_score  writing_score
01M539   111 Columbia Street  Manhattan       657.0          601.0          601.0
02M294      350 Grand Street  Manhattan       395.0          411.0          387.0
02M308      350 Grand Street  Manhattan       418.0          428.0          415.0

本练习是课程的一部分

使用 Python 的 ETL 和 ELT

查看课程

练习说明

  • 使用 .loc[] 仅保留 "city""math_score""reading_score""writing_score" 列。
  • "city" 列对 DataFrame 分组,并计算各城市的数学、阅读和写作成绩的均值。
  • 使用 transform() 函数创建一个按组转换后的 DataFrame。

交互式实操练习

通过完成这段示例代码来试试这个练习。

def transform(raw_data):
	# Use .loc[] to only return the needed columns
	raw_data = raw_data.____[:, ____]
	
    # Group the data by city, return the grouped DataFrame
	grouped_data = raw_data.____(by=["____"], axis=0).____()
	return grouped_data

# Transform the data, print the head of the DataFrame
grouped_testing_scores = ____(raw_testing_scores)
print(grouped_testing_scores.head())
编辑并运行代码