Імпортуйте підмножину стовпців
Податкові дані штату Вермонт містять 147 стовпців, які описують склад домогосподарств, джерела доходів і сплачені податки за поштовим індексом (ZIP) та групою доходу. Для більшості аналізів усі ці стовпці не потрібні. У цій вправі ви створите датафрейм з меншою кількістю змінних, використавши аргумент usecols функції read_csv().
Зосередьмося на складі домогосподарств, щоб перевірити, чи є відмінності за географією та рівнем доходу. Для цього нам потрібні стовпці про групу доходу, поштовий індекс (ZIP code), статус подання податкової декларації (наприклад, одинаки чи у шлюбі) та утриманців. У даних для назв змінних використано коди, тож конкретні потрібні стовпці наведено в інструкціях.
pandas уже імпортовано як pd.
Ця вправа є частиною курсу
Оптимізоване завантаження даних із pandas
Інструкції до вправи
- Створіть список стовпців для використання:
zipcode,agi_stub(група доходу),mars1(кількість домогосподарств-одинаків),MARS2(кількість домогосподарств, що подаються як одружені), іNUMDEP(кількість утриманців). - Створіть датафрейм із файлу
vt_tax_data_2016.csv, що міститиме лише вибрані стовпці.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create list of columns to use
cols = ____
# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)
# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())