Kiểm thử end-to-end một pipeline dữ liệu
Trong bài tập này, bạn sẽ làm việc với cùng một pipeline dữ liệu như trước, pipeline này thực hiện extract, transform và load dữ liệu thuế. Bạn sẽ luyện tập kiểm thử end-to-end pipeline này để đảm bảo giải pháp có thể chạy nhiều lần mà không tạo dữ liệu trùng lặp trong tệp parquet.
pandas đã được nạp với bí danh pd, và các hàm extract(), transform() và load() đã được định nghĩa sẵn.
Bài tập này là một phần của khóa học
ETL và ELT với Python
Hướng dẫn bài tập
- Chạy pipeline ETL ba lần bằng một vòng lặp
for. - In kích thước (
shape) củaclean_tax_dataở mỗi lượt chạy của pipeline. - Đọc DataFrame được lưu trong tệp
"clean_tax_data.parquet"vào biếnto_validate. - Xuất ra
shapecủa DataFrameto_validate, rồi so sánh vớishapecủaclean_tax_rateđể đảm bảo dữ liệu không bị trùng lặp sau mỗi lần chạy pipeline.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
print(f"Attempt: {attempt}")
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
load(clean_tax_data, "clean_tax_data.parquet")
# Print the shape of the cleaned_tax_data DataFrame
print(f"Shape of clean_tax_data: {clean_tax_data.____}")
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")