你在 Global Retail Analytics 的團隊維運一個由 3 個工作組成的 Databricks Job,每晚匯入、清理並彙總零售資料。一位資深工程師建議改用 Lakeflow 的 @dlt.table 模式重寫這條管線。
@dlt.table
將這條管線改用 Lakeflow 的主要優點是什麼?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
在本章中,你將學會使用 Databricks 筆記本、將 CSV 資料載入為 Spark DataFrame,並透過 PySpark 與 SQL 進行資料塑形。
學習如何明確定義結構、建立資料清理管線,並透過廣播連接最佳化查詢效能。
學習如何使用視窗函式計算累積總和與排名、建立串流管線,並部署生產環境工作流程。
當前練習