НачатьНачать бесплатно

Импорт подмножества столбцов

Налоговые данные штата Вермонт содержат 147 столбцов, описывающих состав домохозяйств, источники доходов и уплаченные налоги в разбивке по почтовым индексам и группам доходов. Большинство анализов не требуют всех этих столбцов. В этом упражнении вы создадите датафрейм с меньшим числом переменных, используя аргумент usecols функции read_csv().

Сосредоточимся на составе домохозяйств, чтобы выявить различия по географии и уровню дохода. Для этого нам понадобятся столбцы с информацией о группе доходов, почтовом индексе, статусе подачи налоговой декларации (например, одиночный или совместный) и иждивенцах. В данных используются кодовые названия переменных — нужные столбцы указаны в инструкциях.

pandas уже импортирован как pd.

Это упражнение является частью курса

Эффективный импорт данных с pandas

Посмотреть курс

Инструкции к упражнению

  • Создайте список столбцов для использования: zipcode, agi_stub (группа доходов), mars1 (количество одиночных домохозяйств), MARS2 (количество домохозяйств, подающих декларацию совместно) и NUMDEP (количество иждивенцев).
  • Создайте датафрейм из файла vt_tax_data_2016.csv, используя только выбранные столбцы.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create list of columns to use
cols = ____

# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)

# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())
Редактировать и запускать код