匯入部分欄位
Vermont 的稅務資料包含 147 個欄位,描述各郵遞區號與所得等級下的家庭組成、所得來源與已繳稅額。大多數分析其實不需要所有欄位。在本練習中,你會用 read_csv() 的 usecols 參數建立一個欄位較少的 dataframe。
我們先關注家庭組成,看看是否會隨地理位置與所得水準而不同。為此,我們需要關於所得等級、郵遞區號、報稅身分類別(例如單身或已婚)以及受扶養人數的欄位。資料的變數名稱以代碼表示,所需的特定欄位已列在說明中。
pandas 已匯入為 pd。
本練習屬於課程
使用 pandas 的精實資料導入
練習說明
- 建立要使用的欄位清單:
zipcode、agi_stub(所得等級)、mars1(單身報稅戶數)、MARS2(以已婚身分報稅的戶數)、NUMDEP(受扶養人數)。 - 從
vt_tax_data_2016.csv建立只包含所選欄位的 dataframe。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create list of columns to use
cols = ____
# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)
# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())