CommencezCommencez gratuitement

Filtrer des DataFrames pandas

Une fois les données extraites d'un système source, c'est le moment de les transformer ! Souvent, les données sources contiennent plus d'information que nécessaire pour les cas d'utilisation en aval. Dans ce cas, il faut réduire la dimensionnalité durant la phase de « transformation » du pipeline de données.

pandas a été importé sous le nom pd, et la fonction extract() est disponible pour charger un DataFrame à partir du chemin qui lui est transmis.

Cette activité fait partie du cours

ETL et ELT en Python

Voir le cours

Instructions de l’exercice

  • Utilisez la fonction extract() pour charger le DataFrame stocké au chemin "sales_data.parquet".
  • Mettez à jour la fonction transform() afin de retourner toutes les lignes et colonnes où "Quantity Ordered" est supérieur à 1.
  • Filtrez ensuite le DataFrame clean_data pour ne conserver que les colonnes "Order Date", "Quantity Ordered" et "Purchase Address".
  • Retournez le DataFrame filtré.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")

def transform(raw_data):
  	# Only keep rows with `Quantity Ordered` greater than 1
    clean_data = raw_data.____[____, :]
    
    # Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
    clean_data = ____
    
    # Return the filtered DataFrame
    return ____
    
transform(raw_sales_data)
Modifier et exécuter le code