以下哪一個 不 被視為 Big Data 的三個 V 之一?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
本章將介紹精彩的 Big Data 世界,以及處理 Big Data 的各種概念與不同框架。你將了解為什麼 Apache Spark 被視為 Big Data 的最佳框架。
當前練習
Spark 提供的主要抽象是 RDD(resilient distributed dataset),這是此引擎的核心與支柱型別。本章將介紹 RDD,並示範如何使用 RDD 的 Transformations 與 Actions 來建立與執行 RDD。
本章將帶你認識 Spark SQL——一個用於結構化資料處理的 Spark 模組。它提供稱為 DataFrame 的程式設計抽象,也能作為分散式 SQL 查詢引擎使用。本章將示範如何在 Python 中使用 Spark SQL 操作 DataFrame。
PySpark MLlib 是 Apache Spark 在 Python 中可擴展的機器學習函式庫,包含常見的學習演算法與工具。在最後一章中,你將學習重要的機器學習演算法。你會建立電影推薦引擎與垃圾郵件過濾器,並使用 k-means 分群。