Importer un sous-ensemble de colonnes
Les données fiscales du Vermont contiennent 147 colonnes décrivant la composition des ménages, les sources de revenu et les impôts payés par code postal (ZIP) et par groupe de revenu. La plupart des analyses n'ont pas besoin de toutes ces colonnes. Dans cet exercice, vous allez créer un dataframe avec moins de variables en utilisant l'argument usecols de read_csv().
Concentrons-nous sur la composition des ménages pour voir s'il existe des différences selon la région et le niveau de revenu. Pour ce faire, nous aurons besoin des colonnes sur le groupe de revenu, le code postal (ZIP), l'état de la déclaration de revenus (p. ex., célibataire ou marié) et les personnes à charge. Les noms des variables dans les données sont codés, donc les colonnes précises à utiliser figurent dans les instructions.
pandas a déjà été importé sous le nom pd.
Cette activité fait partie du cours
Ingestion de données rationalisée avec pandas
Instructions de l’exercice
- Créez une liste des colonnes à utiliser :
zipcode,agi_stub(groupe de revenu),mars1(nombre de ménages déclarant comme célibataires),MARS2(nombre de ménages déclarant comme mariés) etNUMDEP(nombre de personnes à charge). - Créez un dataframe à partir de
vt_tax_data_2016.csvqui n'utilise que les colonnes sélectionnées.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create list of columns to use
cols = ____
# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)
# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())