การจัดการ exception เมื่อโหลดข้อมูล
บางครั้ง data pipeline อาจเกิด exception ขึ้น ซึ่ง exception เหล่านี้ทำหน้าที่เป็นการแจ้งเตือน ช่วยให้ Data Engineer รู้ว่ามีสิ่งผิดปกติเกิดขึ้น การจัดการ exception อย่างถูกต้องจึงเป็นเรื่องสำคัญมาก ในแบบฝึกหัดนี้ เราจะฝึกทำสิ่งนั้นกัน!
เพื่อช่วยให้เริ่มต้นได้ง่ายขึ้น pandas ถูก import เป็น pd พร้อมกับโมดูล logging และได้ตั้งค่า log level เริ่มต้นเป็น "debug" แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ETL และ ELT ด้วย Python
คำแนะนำการฝึกหัด
- อัปเดต pipeline โดยเพิ่มบล็อก
tryและพยายามอ่านข้อมูลจาก path"sales_data.parquet" - ดักจับ
FileNotFoundErrorหากไม่สามารถอ่านไฟล์เข้าสู่ DataFrame ของpandasได้ - สร้าง log ระดับ error เพื่อบันทึกความล้มเหลวที่เกิดขึ้น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
def extract(file_path):
return pd.read_parquet(file_path)
# Update the pipeline to include a try block
____:
# Attempt to read in the file
raw_sales_data = extract("____")
# Catch the FileNotFoundError
except ____ as file_not_found:
# Write an error-level log
logging.____(file_not_found)