Import vybrané podmnožiny sloupců
Daňová data z Vermontu obsahují 147 sloupců popisujících složení domácností, zdroje příjmů a zaplacené daně podle PSČ a příjmové skupiny. Většina analýz ale všechny tyto sloupce nepotřebuje. V tomto cvičení vytvoříš dataframe s menším počtem proměnných pomocí argumentu usecols funkce read_csv().
Zaměříme se na složení domácností, abychom zjistili, zda existují rozdíly podle geografie a výše příjmů. K tomu potřebujeme sloupce s informacemi o příjmové skupině, PSČ, způsobu podání daňového přiznání (např. svobodný/á nebo ženatý/vdaná) a počtu závislých osob. Data používají kódová označení proměnných – konkrétní potřebné sloupce jsou uvedené v pokynech.
pandas je již naimportován jako pd.
Toto cvičení je součástí kurzu
Streamlined Data Ingestion with pandas
Pokyny k cvičení
- Vytvoř seznam sloupců, které chceš použít:
zipcode,agi_stub(příjmová skupina),mars1(počet jednočlenných domácností),MARS2(počet domácností podávajících přiznání jako manželský pár) aNUMDEP(počet závislých osob). - Vytvoř dataframe ze souboru
vt_tax_data_2016.csv, který bude obsahovat pouze vybrané sloupce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create list of columns to use
cols = ____
# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)
# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())