以下哪一項「不是」指定 Spark 叢集位置的有效方式?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
Spark 是用來處理 Big Data 的框架。本章將介紹 Spark 與機器學習的背景。然後你會學到如何用 Python 連線到 Spark 並載入 CSV 資料。
當前練習
既然你已熟悉如何把資料載入 Spark,接下來將建立兩種分類模型:決策樹與羅吉斯回歸。你也會了解幾種資料前處理的方法。
接下來你會學習建立線性迴歸模型。你也會學到如何透過工程化新預測變數來擴充資料,以及一種穩健的方法來只選出最相關的預測變數。
最後你會學到如何讓模型更有效率。你會了解如何使用管線讓程式碼更清楚、也更易於維護。接著你會用交叉驗證來更好地測試模型並挑選適合的模型參數。最後你會試作兩種集成模型。