Importer des données à partir d'autres fichiers plats
Même si les fichiers CSV sont les plus courants parmi les fichiers plats, il arrive que certains utilisent d'autres délimiteurs. read_csv() peut tous les lire grâce au paramètre nommé sep. Par défaut, pandas suppose que le séparateur est une virgule, ce qui explique pourquoi nous n'avons pas besoin de préciser sep pour les CSV.
La version des données fiscales du Vermont fournie ici est un fichier à valeurs séparées par des tabulations (TSV). Vous devrez donc utiliser sep pour indiquer le bon délimiteur lors du chargement du fichier. Rappelez-vous que les tabulations sont représentées par \t. Une fois le fichier chargé, le reste du code regroupe le champ N1, qui contient des catégories de tranches de revenu, afin de créer un graphique des déclarations de revenus par catégorie de revenu.
Cette activité fait partie du cours
Ingestion de données rationalisée avec pandas
Instructions de l’exercice
- Importez
pandasavec l'aliaspd. - Chargez
vt_tax_data_2016.tsven vous assurant de définir le bon délimiteur avec le paramètresep.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import pandas with the alias pd
____
# Load TSV using the sep keyword argument to set delimiter
data = ____(____, ____)
# Plot the total number of tax returns by income group
counts = data.groupby("agi_stub").N1.sum()
counts.plot.bar()
plt.show()