資料管線架構樣式
在建立資料管線時,最好將定義函式的檔案與實際執行的檔案分開。
在本練習中,你會先把管線中的元件匯入記憶體,接著再使用這些函式來端到端執行整個管線。此專案的結構如下,其中 pipeline_utils 內含將用來執行管線的 extract()、transform() 與 load() 函式。
> ls
etl_pipeline.py
pipeline_utils.py
本練習屬於課程
使用 Python 的 ETL 與 ELT
練習說明
- 從
pipeline_utils模組匯入extract、transform與load函式。 - 使用匯入的函式來端到端執行資料管線。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")