你在 Sierra Publishing 的一條對業務高度關鍵的資料管線仰賴高流量的資料串流,來源是 Kafka 資料串流。我們需要讀取這些資料,並將它與其他幾個資料集進行串接。
你的資料工程團隊希望使用 Databricks 提升此資料管線的效率,並讓下游使用者能即時讀取這些資料以進行分析。
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
了解雲端資料策略中的新 Lakehouse 範式,以及 Databricks Lakehouse 平台如何讓你的資料架構現代化。認識 Databricks 平台的基礎元件,以及它們如何彼此整合。
學習使用 Databricks 的功能來處理、轉換與清理你的資料。實作 Delta 儲存格式、Delta Live Tables 與 Workflows 等能力,將它們結合起來建立端到端的資料管線。
當前練習
將 Databricks Lakehouse 平台作為你的資料倉儲解決方案,以支援商業智慧(BI)情境。使用 Databricks 內建、為 SQL 最佳化的功能,在你的資料上建立查詢與儀表板。
使用 Databricks 以受管的 MLFlow 管理你的機器學習管線。透過 Feature Store、Model Registry 與 Model Serving Endpoints,從端到端走過模型開發生命週期,在 Lakehouse 中打造健全的 MLOps 平台。