ÎncepețiÎncepe gratuit

Importă un subset de coloane

Setul de date fiscale din Vermont conține 147 de coloane care descriu componența gospodăriei, sursele de venit și impozitele plătite, organizate pe cod poștal și grupă de venit. Majoritatea analizelor nu au nevoie de toate aceste coloane. În acest exercițiu, vei crea un dataframe cu mai puține variabile folosind argumentul usecols al funcției read_csv().

Ne vom concentra pe componența gospodăriei pentru a vedea dacă există diferențe în funcție de geografie și nivelul venitului. Pentru aceasta, avem nevoie de coloane referitoare la grupa de venit, codul poștal, statutul de depunere a declarației fiscale (de exemplu, necăsătorit sau căsătorit) și persoanele aflate în întreținere. Datele folosesc coduri pentru numele variabilelor, iar coloanele necesare sunt specificate în instrucțiuni.

pandas a fost deja importat ca pd.

Acest exercițiu face parte din cursul

Ingestie eficientă a datelor cu pandas

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează o listă cu coloanele de utilizat: zipcode, agi_stub (grupa de venit), mars1 (numărul gospodăriilor formate dintr-o singură persoană), MARS2 (numărul gospodăriilor care depun declarație în calitate de căsătoriți) și NUMDEP (numărul persoanelor aflate în întreținere).
  • Creează un dataframe din fișierul vt_tax_data_2016.csv care să folosească doar coloanele selectate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create list of columns to use
cols = ____

# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)

# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())
Editează și rulează codul