开始使用免费开始使用

仅导入部分列

Vermont 的税务数据包含 147 列,按邮政编码和收入组描述家庭构成、收入来源以及已缴税额。大多数分析并不需要所有这些列。本练习中,您将使用 read_csv()usecols 参数创建一个只包含较少变量的数据框。

我们将聚焦于家庭构成,看看地理位置和收入水平是否存在差异。为此,我们需要收入组、邮政编码、报税申报状态(例如单身或已婚)以及受抚养人等列。数据使用代码作为变量名,所需的具体列见下方说明。

pandas 已经以 pd 的名称导入。

本练习是课程的一部分

使用 pandas 高效导入数据

查看课程

练习说明

  • 创建要使用的列名列表:zipcodeagi_stub(收入组)、mars1(单身家庭数量)、MARS2(以已婚身份申报的家庭数量)以及 NUMDEP(受抚养人数)。
  • vt_tax_data_2016.csv 创建一个数据框,只使用选定的这些列。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create list of columns to use
cols = ____

# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)

# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())
编辑并运行代码