Kom igångKom igång gratis

Importera en delmängd av kolumner

Vermontdata över skatteuppgifter innehåller 147 kolumner som beskriver hushållssammansättning, inkomstkällor och skatter per postnummer och inkomstgrupp. De flesta analyser behöver inte alla dessa kolumner. I den här övningen skapar du en dataframe med färre variabler med hjälp av argumentet usecols i read_csv().

Vi fokuserar på hushållssammansättning för att se om det finns skillnader utifrån geografi och inkomstnivå. För det behöver vi kolumner för inkomstgrupp, postnummer, skattedeklarationsstatus (t.ex. ogift eller gift) och anhöriga. Datamängden använder koder som variabelnamn, så de specifika kolumner som behövs finns i instruktionerna.

pandas har redan importerats som pd.

Den här övningen är en del av kursen

Effektiv datainläsning med pandas

Visa kurs

Övningsinstruktioner

  • Skapa en lista med kolumner att använda: zipcode, agi_stub (inkomstgrupp), mars1 (antal ensamhushåll), MARS2 (antal hushåll som deklarerar som gifta) och NUMDEP (antal anhöriga).
  • Skapa en dataframe från vt_tax_data_2016.csv som bara använder de valda kolumnerna.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create list of columns to use
cols = ____

# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)

# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())
Redigera och kör kod