Importer un fichier par blocs
Avec de gros fichiers, il est souvent plus simple de charger et de traiter les données par morceaux. Exerçons-nous avec les données fiscales du Vermont.
Les 500 premières lignes ont été chargées sous le nom vt_data_first500. Vous allez récupérer les 500 lignes suivantes. Pour ce faire, vous utiliserez plusieurs arguments nommés : nrows et skiprows pour obtenir les bons enregistrements, header pour indiquer à pandas que les données n'ont pas de noms de colonnes, et names pour fournir les noms de colonnes manquants. Vous voudrez aussi utiliser la fonction list() pour récupérer les noms de colonnes de vt_data_first500 et les réutiliser.
pandas a été importé sous l'alias pd.
Cette activité fait partie du cours
Ingestion de données rationalisée avec pandas
Instructions de l’exercice
- Utilisez
nrowsetskiprowspour créer un dataframe,vt_data_next500, avec les 500 lignes suivantes. - Définissez l'argument
headerpour quepandassache qu'il n'y a pas de ligne d'en-tête. - Nommez les colonnes de
vt_data_next500en fournissant à l'argumentnamesune liste des colonnes devt_data_first500.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv",
____,
____,
____,
____)
# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())