開始使用免費開始

資料管線架構樣式

在建立資料管線時,最好將定義函式的檔案與實際執行的檔案分開。

在本練習中,你會先把管線中的元件匯入記憶體,接著再使用這些函式來端到端執行整個管線。此專案的結構如下,其中 pipeline_utils 內含將用來執行管線的 extract()transform()load() 函式。

> ls
 etl_pipeline.py
 pipeline_utils.py

本練習屬於課程

使用 Python 的 ETL 與 ELT

檢視課程

練習說明

  • pipeline_utils 模組匯入 extracttransformload 函式。
  • 使用匯入的函式來端到端執行資料管線。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import the extract, transform, and load functions from pipeline_utils
____

# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")
編輯並執行程式碼