Wczytywanie danych z innych plików płaskich
Pliki CSV są najczęściej spotykanym rodzajem pliku płaskiego, ale czasem trafisz na pliki używające innych separatorów. Funkcja read_csv() potrafi wczytać każdy z nich dzięki argumentowi sep. Domyślnie pandas zakłada, że separatorem jest przecinek – dlatego nie trzeba podawać sep w przypadku plików CSV.
Wersja danych podatkowych stanu Vermont użyta w tym ćwiczeniu to plik z wartościami rozdzielanymi tabulatorami (TSV), więc musisz użyć argumentu sep, aby przekazać właściwy separator podczas wczytywania pliku. Pamiętaj, że tabulator jest reprezentowany jako \t. Po załadowaniu pliku pozostały kod grupuje pole N1, które zawiera kategorie zakresów dochodów, i tworzy wykres zeznań podatkowych według kategorii dochodów.
To ćwiczenie jest częścią kursu
Sprawne importowanie danych z pandas
Instrukcje do ćwiczenia
- Zaimportuj bibliotekę
pandasz aliasempd. - Wczytaj plik
vt_tax_data_2016.tsv, pamiętając o ustawieniu właściwego separatora za pomocą argumentusep.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import pandas with the alias pd
____
# Load TSV using the sep keyword argument to set delimiter
data = ____(____, ____)
# Plot the total number of tax returns by income group
counts = data.groupby("agi_stub").N1.sum()
counts.plot.bar()
plt.show()