Machine Learning 管線
在接下來的兩個章節中,你會逐步走過機器學習管線的每個階段,從資料導入到模型評估。準備開始吧!
pyspark.ml 模組的核心,是 Transformer 和 Estimator 類別。模組中的幾乎所有其他類別,其行為都與這兩個基本類別相似。
Transformer 類別有一個 .transform() 方法,會接收一個 DataFrame 並回傳新的 DataFrame;通常是在原本的資料上附加一個新欄位。例如,你可以使用 Bucketizer 這個類別,將連續型特徵切成離散分箱,或使用 PCA 來透過主成分分析降低資料集的維度。
Estimator 類別都實作了 .fit() 方法。這些方法同樣接收一個 DataFrame,但不會回傳另一個 DataFrame,而是回傳一個模型物件。這可以是像 StringIndexerModel 這樣的物件,用來把以字串儲存的類別型資料納入模型,或是 RandomForestModel,使用隨機森林演算法來做分類或迴歸。
以下哪一項關於 Spark 中的機器學習是「不正確」的?
本練習屬於課程
