Importowanie wybranych kolumn
Dane podatkowe stanu Vermont zawierają 147 kolumn opisujących skład gospodarstw domowych, źródła dochodów oraz zapłacone podatki – z podziałem na kody pocztowe i grupy dochodowe. Większość analiz nie wymaga wszystkich tych kolumn. W tym ćwiczeniu utworzysz ramkę danych z mniejszą liczbą zmiennych, korzystając z argumentu usecols funkcji read_csv().
Skupmy się na składzie gospodarstw domowych, żeby sprawdzić, czy istnieją różnice ze względu na lokalizację i poziom dochodów. Będziemy potrzebować kolumn dotyczących grupy dochodowej, kodu pocztowego, statusu rozliczenia podatkowego (np. osoba samotna lub małżeństwo) oraz liczby osób na utrzymaniu. Dane używają kodów jako nazw zmiennych – konkretne potrzebne kolumny znajdziesz w instrukcjach.
pandas zostało już zaimportowane jako pd.
To ćwiczenie jest częścią kursu
Sprawne importowanie danych z pandas
Instrukcje do ćwiczenia
- Utwórz listę kolumn do użycia:
zipcode,agi_stub(grupa dochodowa),mars1(liczba jednoosobowych gospodarstw domowych),MARS2(liczba gospodarstw rozliczających się jako małżeństwo) orazNUMDEP(liczba osób na utrzymaniu). - Utwórz ramkę danych z pliku
vt_tax_data_2016.csv, używając tylko wybranych kolumn.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create list of columns to use
cols = ____
# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)
# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())