Mẫu kiến trúc data pipeline
Khi xây dựng data pipeline, tốt nhất là tách riêng các tệp nơi định nghĩa hàm khỏi nơi chúng được chạy.
Trong bài tập này, bạn sẽ luyện tập import các thành phần của một pipeline vào bộ nhớ trước khi dùng các hàm này để chạy pipeline từ đầu đến cuối. Dự án có cấu trúc như sau, trong đó pipeline_utils chứa các hàm extract(), transform(), và load() sẽ được dùng để chạy pipeline.
> ls
etl_pipeline.py
pipeline_utils.py
Bài tập này là một phần của khóa học
ETL và ELT với Python
Hướng dẫn bài tập
- Import các hàm
extract,transform, vàloadtừ modulepipeline_utils. - Dùng các hàm đã import để chạy data pipeline từ đầu đến cuối.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")