Використання DataFrame
Основна структура даних у Spark — це Resilient Distributed Dataset (RDD). Це низькорівневий об'єкт, який дає змогу Spark розподіляти дані між кількома вузлами кластера. Однак працювати безпосередньо з RDD складно, тож у цьому курсі ви використовуватимете абстракцію Spark DataFrame, побудовану поверх RDD.
Spark DataFrame розроблено так, щоб він поводився подібно до таблиці SQL (таблиці зі змінними у стовпцях і спостереженнями в рядках). DataFrame не лише легше зрозуміти, вони також краще оптимізовані для складних операцій, ніж RDD.
Коли ви починаєте змінювати й поєднувати стовпці та рядки даних, існує багато способів отримати той самий результат, але деякі з них значно повільніші за інші. Працюючи з RDD, саме дата-сайєнтист має визначити правильний спосіб оптимізувати запит, а в реалізації DataFrame більшість такої оптимізації вже вбудовано!
Щоб почати працювати зі Spark DataFrame, спершу створіть об'єкт SparkSession із вашого SparkContext. Можете думати про SparkContext як про з'єднання з кластером, а SparkSession — як про інтерфейс для роботи через це з'єднання.
Пам'ятайте: упродовж усього цього курсу у вашому робочому середовищі буде доступний SparkSession з назвою spark!
Яка з наведених нижче переваг характерна для Spark DataFrame порівняно з RDD?
Ця вправа є частиною курсу
Основи PySpark
Практична інтерактивна вправа
Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ
Почати вправу