Импорт подмножества столбцов
Налоговые данные штата Вермонт содержат 147 столбцов, описывающих состав домохозяйств, источники доходов и уплаченные налоги в разбивке по почтовым индексам и группам доходов. Большинство анализов не требуют всех этих столбцов. В этом упражнении вы создадите датафрейм с меньшим числом переменных, используя аргумент usecols функции read_csv().
Сосредоточимся на составе домохозяйств, чтобы выявить различия по географии и уровню дохода. Для этого нам понадобятся столбцы с информацией о группе доходов, почтовом индексе, статусе подачи налоговой декларации (например, одиночный или совместный) и иждивенцах. В данных используются кодовые названия переменных — нужные столбцы указаны в инструкциях.
pandas уже импортирован как pd.
Это упражнение является частью курса
Эффективный импорт данных с pandas
Инструкции к упражнению
- Создайте список столбцов для использования:
zipcode,agi_stub(группа доходов),mars1(количество одиночных домохозяйств),MARS2(количество домохозяйств, подающих декларацию совместно) иNUMDEP(количество иждивенцев). - Создайте датафрейм из файла
vt_tax_data_2016.csv, используя только выбранные столбцы.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create list of columns to use
cols = ____
# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)
# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())