CommencezCommencez gratuitement

Extraire des données à partir de fichiers Parquet

L'une des façons les plus courantes d'ingérer des données depuis un système source consiste à lire un fichier, par exemple un fichier CSV. Comme les données ont pris de l'ampleur, le besoin de formats de fichiers plus efficaces a mené à de nouveaux formats en colonnes, comme les fichiers Parquet.

Dans cet exercice, vous allez vous exercer à extraire des données d'un fichier Parquet.

Cette activité fait partie du cours

ETL et ELT en Python

Voir le cours

Instructions de l’exercice

  • Lisez le fichier Parquet situé au chemin "sales_data.parquet" dans un DataFrame pandas.
  • Vérifiez les types de données du DataFrame en les affichant avec print().
  • Affichez la dimension (shape) du DataFrame ainsi que ses premières lignes (head).

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

import pandas as pd

# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")

# Check the data type of the columns of the DataFrames
print(sales_data.____)

# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())
Modifier et exécuter le code