Spark 目前是处理海量数据最受欢迎的技术之一。它不仅能处理极大的数据量,而且效率很高!此外,与一些其他分布式计算技术不同,使用 Spark 开发是件令人愉快的事。
以下哪些选项描述了 Spark?
本练习是课程的一部分
通过我们的互动练习之一,将理论转化为实践
Spark 是用于处理大数据的框架。本章将介绍 Spark 和机器学习的背景知识。随后,您将学习如何使用 Python 连接 Spark 并加载 CSV 数据。
当前练习
在熟悉了如何将数据导入 Spark 之后,您将开始构建两类分类模型:决策树和逻辑回归。您还将了解几种数据准备的方法。
接下来,您将学习创建线性回归模型。您还会学习如何通过构造新预测变量来增强数据,以及一种稳健的方法来仅选择最相关的预测变量。
最后,您将学习如何提升模型的效率。您会了解如何使用流水线让代码更清晰、更易维护。随后,您将使用交叉验证更好地测试模型并选择合适的模型参数。最后,您还会接触两类集成模型。