下列哪一项不被认为是大数据三个 V 之一?
本练习是课程的一部分
通过我们的互动练习之一,将理论转化为实践
本章节将带您进入精彩的大数据世界,介绍处理大数据的核心概念和不同框架。您将了解为何 Apache Spark 被认为是处理 BigData 的最佳框架。
当前练习
Spark 提供的主要抽象是弹性分布式数据集(RDD),这是该引擎的基础且核心的数据类型。本章节将介绍 RDD,并展示如何通过 RDD 的 Transformations 与 Actions 创建并执行 RDD。
本章节将介绍 Spark SQL,它是用于结构化数据处理的 Spark 模块。它提供名为 DataFrame 的编程抽象,也可作为分布式 SQL 查询引擎使用。本章节将展示 Spark SQL 如何在 Python 中使用 DataFrame。
PySpark MLlib 是 Apache Spark 在 Python 中的可扩展机器学习库,包含常用的学习算法与工具。在本最后一章中,您将学习重要的机器学习算法。您将构建电影推荐引擎和垃圾邮件过滤器,并使用 k-means 聚类。