Určení datových typů
Při načítání plochého souboru pandas automaticky odhadne nejvhodnější datový typ pro každý sloupec. Někdy ale jeho odhady nejsou přesné – zvláště u čísel, která představují kategorie nebo vlastnosti, nikoli číselné hodnoty.
Pohled do datového slovníku pro vt_tax_data_2016.csv odhalí dva takové sloupce. Sloupec agi_stub obsahuje čísla odpovídající kategoriím příjmů a sloupec zipcode má pětimístné hodnoty, které by měly být řetězce – pokud bychom je zpracovávali jako celá čísla, přišli bychom o úvodní nuly, které nesou důležitou informaci. Pojďme nastavit správné datové typy pomocí argumentu dtype.
pandas je už naimportován jako pd.
Toto cvičení je součástí kurzu
Streamlined Data Ingestion with pandas
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load csv with no additional arguments
data = ____("vt_tax_data_2016.csv")
# Print the data types
print(____)