想像你在一個有 10 個節點的叢集上收到 2 個大型資料檔。每個檔案都包含約 1,000 萬列,列大小相近。處理資料時整體反應速度還可以,但從檔案做初次讀取需要相當長的時間。注意,只有你會使用這份資料,而且每次執行時資料都會改變。
以下哪一個選項最能改善效能?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
複習 DataFrame 的基礎概念,並說明資料清理的重要性。
探討在 Spark 中修改 DataFrame 內容的各種技巧。
透過提升效能或降低資源需求,改進資料清理工作。
當前練習
學習如何使用 Spark 處理複雜的真實世界資料,以及管線的基本概念。