你在 Global Retail Analytics 的串流管線會從 Unity Catalog 的 volume 讀取新進的 CSV 檔,並寫入 Delta Lake。週末發生停機後,叢集在週一早上重新啟動。週末期間有 3 個新檔案進來。串流只處理這 3 個檔案——前一週的檔案都不會被重新載入。
「是什麼機制」讓串流可以略過先前已處理的檔案,並精準從中斷處繼續?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
在本章中,你將學會使用 Databricks 筆記本、將 CSV 資料載入為 Spark DataFrame,並透過 PySpark 與 SQL 進行資料塑形。
學習如何明確定義結構、建立資料清理管線,並透過廣播連接最佳化查詢效能。
學習如何使用視窗函式計算累積總和與排名、建立串流管線,並部署生產環境工作流程。
當前練習