Паттерн «подключение — работа — отключение»
Работа с sparklyr во многом напоминает работу с dplyr, когда данные хранятся в базе данных. Собственно, sparklyr преобразует ваш R-код в SQL-код и только затем передаёт его в Spark.
Типичный рабочий процесс состоит из трёх шагов:
- Подключитесь к Spark с помощью
spark_connect(). - Выполните необходимые операции с данными.
- Закройте соединение с Spark с помощью
spark_disconnect().
В этом упражнении вы выполните простейшую операцию: получите версию запущенного Spark с помощью spark_version().
spark_connect() принимает URL, указывающий адрес кластера Spark. Для локального кластера (как в вашем случае) передайте "local". При подключении к удалённому кластеру (на другом сервере) потребуется указать URL и порт.
spark_version() и spark_disconnect() принимают объект соединения Spark в качестве единственного аргумента.
Обратите внимание: установка соединения с кластером занимает несколько секунд, поэтому постоянно подключаться и отключаться нецелесообразно. В рамках упражнений на DataCamp вам придётся переподключаться при каждом новом задании, однако в реальной работе лучше поддерживать соединение открытым на всё время работы со Spark.
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Инструкции к упражнению
- Загрузите пакет
sparklyrс помощьюlibrary(). - Подключитесь к Spark, вызвав
spark_connect()с аргументомmaster = "local". Сохраните результат в переменнуюspark_conn. - Получите версию Spark с помощью
spark_version(), передав аргументsc = spark_conn. - Отключитесь от Spark с помощью
spark_disconnect(), передав аргументsc = spark_conn.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___