在正式環境執行時,監控資料管線的效能非常重要。你先前已學過例外處理與記錄(logging)等工具。在最後這個練習中,我們要實作端到端執行資料管線,同時監控例外並記錄效能。
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
import logging # Import extract, transform, and load functions from pipeline_utils ____
準備好來了解資料如何透過資料管線被蒐集、處理與搬移。你將探索優質資料管線的特性,並開始規劃與設計你自己的管線。
深入學習運用 pandas 來擷取、轉換並載入資料,同時建立你的第一個資料管線。你會學到如何讓 ETL 邏輯可重複使用,並在管線中加入記錄與例外處理。
以進階的資料管線技巧強化你的工作流程,例如處理非表格資料與將 DataFrame 寫入 SQL 資料庫。探索能支援使用 pandas 進行進階轉換的工具,並掌握處理複雜資料的最佳實務。
在最後一章中,你將建立架構來在發佈到正式環境前驗證並測試資料管線。完成測試後,你會探索如何端到端執行資料管線,同時保有對管線效能的可觀測性。
當前練習