ПочатиПочніть безкоштовно

Імпортуйте підмножину стовпців

Податкові дані штату Вермонт містять 147 стовпців, які описують склад домогосподарств, джерела доходів і сплачені податки за поштовим індексом (ZIP) та групою доходу. Для більшості аналізів усі ці стовпці не потрібні. У цій вправі ви створите датафрейм з меншою кількістю змінних, використавши аргумент usecols функції read_csv().

Зосередьмося на складі домогосподарств, щоб перевірити, чи є відмінності за географією та рівнем доходу. Для цього нам потрібні стовпці про групу доходу, поштовий індекс (ZIP code), статус подання податкової декларації (наприклад, одинаки чи у шлюбі) та утриманців. У даних для назв змінних використано коди, тож конкретні потрібні стовпці наведено в інструкціях.

pandas уже імпортовано як pd.

Ця вправа є частиною курсу

Оптимізоване завантаження даних із pandas

Переглянути курс

Інструкції до вправи

  • Створіть список стовпців для використання: zipcode, agi_stub (група доходу), mars1 (кількість домогосподарств-одинаків), MARS2 (кількість домогосподарств, що подаються як одружені), і NUMDEP (кількість утриманців).
  • Створіть датафрейм із файлу vt_tax_data_2016.csv, що міститиме лише вибрані стовпці.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create list of columns to use
cols = ____

# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)

# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())
Редагувати та запускати код