Использование Spark в Python
Первый шаг при работе со Spark — подключение к кластеру.
На практике кластер размещается на удалённой машине, связанной со всеми остальными узлами. Один компьютер, называемый мастером, управляет распределением данных и вычислений. Мастер связан с остальными компьютерами кластера, которые называются воркерами. Мастер отправляет воркерам данные и задачи для обработки, а они возвращают ему результаты.
Если вы только начинаете работать со Spark, удобнее всего запустить кластер локально. Поэтому в этом курсе все вычисления выполняются на серверах DataCamp в симулированном кластере — подключаться к другому компьютеру не потребуется.
Создать подключение так же просто, как создать экземпляр класса SparkContext. Конструктор класса принимает несколько необязательных аргументов, с помощью которых можно задать параметры подключаемого кластера.
Объект с этими параметрами создаётся с помощью конструктора SparkConf(). Подробнее — в документации.
В остальных упражнениях курса объект SparkContext под именем sc уже будет доступен в вашем рабочем пространстве.
Как подключиться к кластеру Spark из PySpark?
Это упражнение является частью курса
Основы PySpark
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение