or
Это упражнение является частью курса
В этой главе вы научитесь создавать и запрашивать SQL-таблицы в Spark. Spark SQL привносит в Spark всю выразительность языка SQL. Вы также освоите оконные функции SQL в Spark. Оконные функции выполняют вычисления по строкам, связанным с текущей строкой. Они значительно упрощают получение результатов, которые трудно выразить с помощью только объединений и традиционных агрегаций. Мы будем использовать оконные функции для вычисления нарастающих сумм, разностей и других операций, которые сложно реализовать средствами базового SQL.
В этой главе вы будете загружать текст на естественном языке, а затем применять анализ скользящего окна для поиска частых последовательностей слов.
В предыдущих главах вы познакомились с возможностями оконных функций SQL. Однако их богатые возможности делают особенно важным понимание того, как правильно кэшировать датафреймы и SQL-таблицы. Не менее важно уметь оценивать производительность своего приложения. Вы научитесь делать это с помощью Spark UI. Также вы изучите лучшие практики журналирования в Spark. Spark SQL предоставляет ещё один полезный инструмент для оптимизации запросов — план выполнения запроса. Вы научитесь использовать план выполнения для анализа происхождения датафрейма.
Текущее упражнение
В предыдущих главах вы освоили инструменты для загрузки необработанного текста, его токенизации и извлечения последовательностей слов. Это уже весьма полезно для анализа, но столь же ценно и для машинного обучения. Всё изученное объединяется в этой главе: вы применяете логистическую регрессию для классификации текста. К концу главы вы загрузите данные на естественном языке и обучите на их основе классификатор текста.