仅导入部分列
Vermont 的税务数据包含 147 列,按邮政编码和收入组描述家庭构成、收入来源以及已缴税额。大多数分析并不需要所有这些列。本练习中,您将使用 read_csv() 的 usecols 参数创建一个只包含较少变量的数据框。
我们将聚焦于家庭构成,看看地理位置和收入水平是否存在差异。为此,我们需要收入组、邮政编码、报税申报状态(例如单身或已婚)以及受抚养人等列。数据使用代码作为变量名,所需的具体列见下方说明。
pandas 已经以 pd 的名称导入。
本练习是课程的一部分
使用 pandas 高效导入数据
练习说明
- 创建要使用的列名列表:
zipcode、agi_stub(收入组)、mars1(单身家庭数量)、MARS2(以已婚身份申报的家庭数量)以及NUMDEP(受抚养人数)。 - 从
vt_tax_data_2016.csv创建一个数据框,只使用选定的这些列。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create list of columns to use
cols = ____
# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)
# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())