使用 DataFrame
Spark 的核心資料結構是 Resilient Distributed Dataset(RDD)。這是一種低階物件,讓 Spark 能把資料分散到叢集中的多個節點來發揮威力。不過,直接操作 RDD 並不容易,因此在本課程中,你會使用建構在 RDD 之上的 Spark DataFrame 抽象層。
Spark DataFrame 的設計與 SQL 資料表非常相似(欄中是變數、列中是觀測值)。DataFrame 不僅更容易理解,對於複雜運算也比 RDD 更具最佳化。
當你開始修改與組合資料的欄與列時,達到同一結果的方法可能有很多,但有些往往會花更長時間。使用 RDD 時,必須由資料科學家自己找出正確的方式來最佳化查詢;然而 DataFrame 的實作已內建了許多這類最佳化!
若要開始使用 Spark DataFrame,你需要先從 SparkContext 建立一個 SparkSession 物件。你可以把 SparkContext 想成與叢集的連線,而 SparkSession 則是與該連線互動的介面。
請記住,在本課程的其餘部分,你的工作環境中都會有名為 spark 的 SparkSession 可供使用!
以下哪一項是 Spark DataFrame 相較於 RDD 的優勢?
本練習屬於課程
