or
本练习是课程的一部分
在本章中,您将学习如何在 Spark 中创建并查询 SQL 表。Spark SQL 将 SQL 的表达力带入 Spark。您还将学习如何在 Spark 中使用 SQL 窗口函数。窗口函数在与当前行相关的多行上执行计算。它们能极大简化仅用连接和传统聚合难以表达的结果。我们将使用窗口函数来执行累计求和、累计差分,以及其他在基础 SQL 中较为困难的操作。
在本章中,您将加载自然语言文本。随后,您将应用移动窗口分析来查找高频词序列。
当前练习
在前几章中,您已经学会了如何使用窗口函数 SQL 的强大表达力。然而,正因为这种表达力,现在有必要理解如何正确缓存 DataFrame 和缓存 SQL 表。同时,了解如何评估您的应用也很重要。您将学习如何使用 Spark UI 来完成这一点。您还将学习 Spark 中的日志记录最佳实践。Spark SQL 还带来了另一个用于优化查询性能的有用工具——查询执行计划。您将学习如何使用执行计划来评估 DataFrame 的来源与演变。
前几章已经为您提供了加载原始文本、进行分词并提取词序列的工具。这些对于分析很有用,对机器学习同样适用。接下来,您将把这些知识结合起来,使用逻辑回归对文本进行分类。到本章结束时,您将加载原始自然语言文本数据,并用它来训练一个文本分类器。