Načítání dat z jiných flat files
Soubory CSV jsou nejběžnějším typem flat file, ale občas narazíš na soubory s jiným oddělovačem. Funkce read_csv() si poradí se všemi díky argumentu sep. Ve výchozím nastavení pandas předpokládá, že oddělovačem je čárka – proto při práci s CSV soubory sep zadávat nemusíš.
Verze dat o daních z Vermontu, se kterou tu pracujeme, je soubor TSV (hodnoty oddělené tabulátorem). Při načítání souboru proto pomocí sep zadej správný oddělovač. Nezapomeň, že tabulátor se zapisuje jako \t. Po načtení souboru zbytek kódu seskupí pole N1, které obsahuje kategorie příjmových pásem, a vytvoří graf daňových přiznání podle příjmové kategorie.
Toto cvičení je součástí kurzu
Streamlined Data Ingestion with pandas
Pokyny k cvičení
- Importuj
pandass aliasempd. - Načti soubor
vt_tax_data_2016.tsva nezapomeň nastavit správný oddělovač pomocí argumentusep.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import pandas with the alias pd
____
# Load TSV using the sep keyword argument to set delimiter
data = ____(____, ____)
# Plot the total number of tax returns by income group
counts = data.groupby("agi_stub").N1.sum()
counts.plot.bar()
plt.show()