or
Ця вправа є частиною курсу
У цьому розділі ви навчитеся створювати й запитувати SQL-таблицю в Spark. Spark SQL додає виразність SQL до Spark. Ви також дізнаєтеся, як використовувати віконні функції SQL у Spark. Віконні функції виконують обчислення для рядків, пов'язаних з поточним рядком. Вони значно спрощують отримання результатів, які важко виразити лише через з'єднання та традиційні агрегації. Ми використаємо віконні функції для накопичувальних сум, різниць та інших операцій, які складно виконати в базовому SQL.
У цьому розділі ви завантажите текст природною мовою. Потім застосуєте ковзний аналіз вікном, щоб знайти часті послідовності слів.
У попередніх розділах ви навчилися користуватися виразністю SQL із віконними функціями. Однак тепер важливо розуміти, як правильно кешувати датафрейми та SQL-таблиці. Також важливо вміти оцінювати роботу застосунку. Ви навчитеся робити це за допомогою Spark UI. Ви також опануєте найкращу практику журналювання в Spark. Spark SQL надає ще один корисний інструмент для налаштування продуктивності запитів — план виконання запиту. Ви дізнаєтеся, як використовувати план виконання для оцінювання походження (provenance) датафрейму.
Поточна вправа
У попередніх розділах ви отримали інструменти для завантаження сирого тексту, його токенізації та виділення послідовностей слів. Це вже корисно для аналізу, а також придатно для машинного навчання. Тепер усе вивчене поєднається в застосуванні логістичної регресії для класифікації тексту. До кінця цього розділу ви завантажите сирі дані природної мови та використаєте їх, щоб навчити текстовий класифікатор.