Journalisation dans un pipeline de données
Dans cet exercice, nous allons revenir sur la fonction que vous avez écrite dans une vidéo précédente et pratiquer l'ajout de la journalisation à cette fonction. Cela vous aidera à diagnostiquer les erreurs et à apporter des changements à la logique !
pandas a été importé sous le nom pd. En plus de cela, le module logging a été importé et le niveau de journalisation par défaut a été fixé à "debug".
Cette activité fait partie du cours
ETL et ELT en Python
Instructions de l’exercice
- Créez un journal de niveau info après la transformation, en passant la chaîne :
"Transformed 'Order Date' column to type 'datetime'." - Consignez la valeur de
.shapedu DataFrame au niveau débogage avant et après le filtrage.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
def transform(raw_data):
raw_data["Order Date"] = pd.to_datetime(raw_data["Order Date"], format="%m/%d/%y %H:%M")
clean_data = raw_data.loc[raw_data["Price Each"] < 10, :]
# Create an info log regarding transformation
logging.____("Transformed 'Order Date' column to type 'datetime'.")
# Create debug-level logs for the DataFrame before and after filtering
____(f"Shape of the DataFrame before filtering: {raw_data.shape}")
____(f"Shape of the DataFrame after filtering: {clean_data.shape}")
return clean_data
clean_sales_data = transform(raw_sales_data)