Začněte nyníZačněte zdarma

Import vybrané podmnožiny sloupců

Daňová data z Vermontu obsahují 147 sloupců popisujících složení domácností, zdroje příjmů a zaplacené daně podle PSČ a příjmové skupiny. Většina analýz ale všechny tyto sloupce nepotřebuje. V tomto cvičení vytvoříš dataframe s menším počtem proměnných pomocí argumentu usecols funkce read_csv().

Zaměříme se na složení domácností, abychom zjistili, zda existují rozdíly podle geografie a výše příjmů. K tomu potřebujeme sloupce s informacemi o příjmové skupině, PSČ, způsobu podání daňového přiznání (např. svobodný/á nebo ženatý/vdaná) a počtu závislých osob. Data používají kódová označení proměnných – konkrétní potřebné sloupce jsou uvedené v pokynech.

pandas je již naimportován jako pd.

Toto cvičení je součástí kurzu

Streamlined Data Ingestion with pandas

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř seznam sloupců, které chceš použít: zipcode, agi_stub (příjmová skupina), mars1 (počet jednočlenných domácností), MARS2 (počet domácností podávajících přiznání jako manželský pár) a NUMDEP (počet závislých osob).
  • Vytvoř dataframe ze souboru vt_tax_data_2016.csv, který bude obsahovat pouze vybrané sloupce.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create list of columns to use
cols = ____

# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)

# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())
Upravit a spustit kód