Bắt đầu ngayBắt đầu miễn phí

Mẫu kiến trúc data pipeline

Khi xây dựng data pipeline, tốt nhất là tách riêng các tệp nơi định nghĩa hàm khỏi nơi chúng được chạy.

Trong bài tập này, bạn sẽ luyện tập import các thành phần của một pipeline vào bộ nhớ trước khi dùng các hàm này để chạy pipeline từ đầu đến cuối. Dự án có cấu trúc như sau, trong đó pipeline_utils chứa các hàm extract(), transform(), và load() sẽ được dùng để chạy pipeline.

> ls
 etl_pipeline.py
 pipeline_utils.py

Bài tập này là một phần của khóa học

ETL và ELT với Python

Xem khóa học

Hướng dẫn bài tập

  • Import các hàm extract, transform, và load từ module pipeline_utils.
  • Dùng các hàm đã import để chạy data pipeline từ đầu đến cuối.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the extract, transform, and load functions from pipeline_utils
____

# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")
Chỉnh sửa và Chạy Mã