Filtrer des DataFrames pandas
Une fois les données extraites d'un système source, c'est le moment de les transformer ! Souvent, les données sources contiennent plus d'information que nécessaire pour les cas d'utilisation en aval. Dans ce cas, il faut réduire la dimensionnalité durant la phase de « transformation » du pipeline de données.
pandas a été importé sous le nom pd, et la fonction extract() est disponible pour charger un DataFrame à partir du chemin qui lui est transmis.
Cette activité fait partie du cours
ETL et ELT en Python
Instructions de l’exercice
- Utilisez la fonction
extract()pour charger le DataFrame stocké au chemin"sales_data.parquet". - Mettez à jour la fonction
transform()afin de retourner toutes les lignes et colonnes où"Quantity Ordered"est supérieur à 1. - Filtrez ensuite le DataFrame
clean_datapour ne conserver que les colonnes"Order Date","Quantity Ordered"et"Purchase Address". - Retournez le DataFrame filtré.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")
def transform(raw_data):
# Only keep rows with `Quantity Ordered` greater than 1
clean_data = raw_data.____[____, :]
# Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
clean_data = ____
# Return the filtered DataFrame
return ____
transform(raw_sales_data)