НачатьНачать бесплатно

Использование Spark в Python

Первый шаг при работе со Spark — подключение к кластеру.

На практике кластер размещается на удалённой машине, связанной со всеми остальными узлами. Один компьютер, называемый мастером, управляет распределением данных и вычислений. Мастер связан с остальными компьютерами кластера, которые называются воркерами. Мастер отправляет воркерам данные и задачи для обработки, а они возвращают ему результаты.

Если вы только начинаете работать со Spark, удобнее всего запустить кластер локально. Поэтому в этом курсе все вычисления выполняются на серверах DataCamp в симулированном кластере — подключаться к другому компьютеру не потребуется.

Создать подключение так же просто, как создать экземпляр класса SparkContext. Конструктор класса принимает несколько необязательных аргументов, с помощью которых можно задать параметры подключаемого кластера.

Объект с этими параметрами создаётся с помощью конструктора SparkConf(). Подробнее — в документации.

В остальных упражнениях курса объект SparkContext под именем sc уже будет доступен в вашем рабочем пространстве.

Как подключиться к кластеру Spark из PySpark?

Это упражнение является частью курса

Основы PySpark

Посмотреть курс

Практическое интерактивное упражнение

Превратите теорию в практику с помощью одного из наших интерактивных упражнений

Начать упражнение