Extraire des données à partir de fichiers Parquet
L'une des façons les plus courantes d'ingérer des données depuis un système source consiste à lire un fichier, par exemple un fichier CSV. Comme les données ont pris de l'ampleur, le besoin de formats de fichiers plus efficaces a mené à de nouveaux formats en colonnes, comme les fichiers Parquet.
Dans cet exercice, vous allez vous exercer à extraire des données d'un fichier Parquet.
Cette activité fait partie du cours
ETL et ELT en Python
Instructions de l’exercice
- Lisez le fichier Parquet situé au chemin
"sales_data.parquet"dans un DataFramepandas. - Vérifiez les types de données du DataFrame en les affichant avec
print(). - Affichez la dimension (
shape) du DataFrame ainsi que ses premières lignes (head).
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
import pandas as pd
# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")
# Check the data type of the columns of the DataFrames
print(sales_data.____)
# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())