Bắt đầu ngayBắt đầu miễn phí

Kiểm thử end-to-end một pipeline dữ liệu

Trong bài tập này, bạn sẽ làm việc với cùng một pipeline dữ liệu như trước, pipeline này thực hiện extract, transform và load dữ liệu thuế. Bạn sẽ luyện tập kiểm thử end-to-end pipeline này để đảm bảo giải pháp có thể chạy nhiều lần mà không tạo dữ liệu trùng lặp trong tệp parquet.

pandas đã được nạp với bí danh pd, và các hàm extract(), transform()load() đã được định nghĩa sẵn.

Bài tập này là một phần của khóa học

ETL và ELT với Python

Xem khóa học

Hướng dẫn bài tập

  • Chạy pipeline ETL ba lần bằng một vòng lặp for.
  • In kích thước (shape) của clean_tax_data ở mỗi lượt chạy của pipeline.
  • Đọc DataFrame được lưu trong tệp "clean_tax_data.parquet" vào biến to_validate.
  • Xuất ra shape của DataFrame to_validate, rồi so sánh với shape của clean_tax_rate để đảm bảo dữ liệu không bị trùng lặp sau mỗi lần chạy pipeline.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
	print(f"Attempt: {attempt}")
	raw_tax_data = extract("raw_tax_data.csv")
	clean_tax_data = transform(raw_tax_data)
	load(clean_tax_data, "clean_tax_data.parquet")
	
	# Print the shape of the cleaned_tax_data DataFrame
	print(f"Shape of clean_tax_data: {clean_tax_data.____}")
    
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")
Chỉnh sửa và Chạy Mã