Работа с DataFrames
Основная структура данных в Spark — это Resilient Distributed Dataset (RDD). Это низкоуровневый объект, который позволяет Spark распределять данные по нескольким узлам кластера. Однако работать с RDD напрямую достаточно сложно, поэтому в этом курсе вы будете использовать абстракцию Spark DataFrame, построенную поверх RDD.
Spark DataFrame разработан так, чтобы работать как таблица SQL: переменные размещаются в столбцах, а наблюдения — в строках. DataFrames не только проще для понимания, но и лучше оптимизированы для сложных операций, чем RDD.
Когда вы начинаете изменять и объединять столбцы и строки данных, существует множество способов получить один и тот же результат, но некоторые из них занимают значительно больше времени. При работе с RDD специалист по данным сам должен выбирать оптимальный способ выполнения запроса, тогда как реализация DataFrame уже содержит встроенную оптимизацию.
Чтобы начать работу со Spark DataFrames, сначала необходимо создать объект SparkSession из вашего SparkContext. SparkContext можно рассматривать как соединение с кластером, а SparkSession — как интерфейс для работы с этим соединением.
Помните: на протяжении всего курса в вашем рабочем пространстве будет доступен объект SparkSession с именем spark!
Какое из перечисленных ниже преимуществ отличает Spark DataFrames от RDD?
Это упражнение является частью курса
Основы PySpark
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение