НачатьНачать бесплатно

Паттерн «подключение — работа — отключение»

Работа с sparklyr во многом напоминает работу с dplyr, когда данные хранятся в базе данных. Собственно, sparklyr преобразует ваш R-код в SQL-код и только затем передаёт его в Spark.

Типичный рабочий процесс состоит из трёх шагов:

  1. Подключитесь к Spark с помощью spark_connect().
  2. Выполните необходимые операции с данными.
  3. Закройте соединение с Spark с помощью spark_disconnect().

В этом упражнении вы выполните простейшую операцию: получите версию запущенного Spark с помощью spark_version().

spark_connect() принимает URL, указывающий адрес кластера Spark. Для локального кластера (как в вашем случае) передайте "local". При подключении к удалённому кластеру (на другом сервере) потребуется указать URL и порт.

spark_version() и spark_disconnect() принимают объект соединения Spark в качестве единственного аргумента.

Обратите внимание: установка соединения с кластером занимает несколько секунд, поэтому постоянно подключаться и отключаться нецелесообразно. В рамках упражнений на DataCamp вам придётся переподключаться при каждом новом задании, однако в реальной работе лучше поддерживать соединение открытым на всё время работы со Spark.

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

  • Загрузите пакет sparklyr с помощью library().
  • Подключитесь к Spark, вызвав spark_connect() с аргументом master = "local". Сохраните результат в переменную spark_conn.
  • Получите версию Spark с помощью spark_version(), передав аргумент sc = spark_conn.
  • Отключитесь от Spark с помощью spark_disconnect(), передав аргумент sc = spark_conn.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load sparklyr
___

# Connect to your Spark cluster
spark_conn <- ___

# Print the version of Spark
___

# Disconnect from Spark
___
Редактировать и запускать код