科技公司會建立複雜且大規模的資料管線,來處理來自數百萬使用者的龐大資料,不論是新進的社群貼文、電視影集的觀看數據,或是最近的線上購物紀錄。
想像一個音樂串流服務的資料管線。在這個練習中,列出了數個管線任務。請將這些任務分類到 ETL 的各步驟中。
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
我們會先定義什麼是資料科學。接著介紹資料科學的工作流程,以及如何應用在真實世界的問題上。最後,你會認識資料科學領域中的不同職務。
既然已經理解資料科學的工作流程,現在更深入第一步:資料蒐集與儲存。你會學到可以取用的各種資料來源、資料的樣貌、資料蒐集後如何儲存,以及如何用資料管線自動化整個流程。
當前練習
資料準備是基礎:資料科學家有 80% 的時間在清理與處理資料,只有 20% 的時間在實際分析。本章會帶你診斷資料中的問題,處理遺漏值與離群值。接著你會學到視覺化,這是同時用來探索資料並傳達發現的關鍵工具。
在最後一章,我們要討論實驗與預測!從實驗開始,我們會介紹 A/B 測試,接著進入時間序列預測,學習如何預測未來事件。最後以機器學習作結,帶你認識監督式學習與分群。