Logování v datovém pipeline
V tomto cvičení se vrátíme k funkci, kterou jsi napsal/a v předchozím videu, a procvičíme přidání logování. To se hodí při hledání chyb nebo při úpravách logiky!
pandas je importován jako pd. Kromě toho je importován modul logging a výchozí úroveň logování je nastavena na "debug".
Toto cvičení je součástí kurzu
ETL a ELT v Pythonu
Pokyny k cvičení
- Po transformaci vytvoř log na úrovni info s textem:
"Transformed 'Order Date' column to type 'datetime'." - Zaloguj
.shapeDataFramu na úrovni debug před filtrováním i po něm.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def transform(raw_data):
raw_data["Order Date"] = pd.to_datetime(raw_data["Order Date"], format="%m/%d/%y %H:%M")
clean_data = raw_data.loc[raw_data["Price Each"] < 10, :]
# Create an info log regarding transformation
logging.____("Transformed 'Order Date' column to type 'datetime'.")
# Create debug-level logs for the DataFrame before and after filtering
____(f"Shape of the DataFrame before filtering: {raw_data.shape}")
____(f"Shape of the DataFrame after filtering: {clean_data.shape}")
return clean_data
clean_sales_data = transform(raw_sales_data)