Začněte nyníZačněte zdarma

Vzor připoj – pracuj – odpoj

Práce s sparklyr je velmi podobná práci s dplyr při přístupu k datům v databázi. sparklyr totiž převádí tvůj R kód do SQL kódu, který pak předá Sparku.

Typický pracovní postup se skládá ze tří kroků:

  1. Připoj se ke Sparku pomocí spark_connect().
  2. Proveď požadovanou práci.
  3. Uzavři připojení ke Sparku pomocí spark_disconnect().

V tomto cvičení provedeš ten nejjednodušší možný úkon: zjistíš verzi běžícího Sparku pomocí spark_version().

spark_connect() přijímá URL s umístěním Sparku. Pro lokální cluster (jako v tomto případě) zadej URL "local". Pro vzdálený cluster (na jiném počítači, typicky výkonném serveru) bude připojovací řetězec obsahovat URL a port.

spark_version() i spark_disconnect() přijímají jako jediný argument připojení ke Sparku.

Jedno důležité upozornění: navázání připojení ke clusteru trvá několik sekund, takže opakované připojování a odpojování je nepraktické. V rámci cvičení na DataCampu se musíš vždy znovu připojit, ale při práci s sparklyr ve vlastních projektech je obvykle nejlepší ponechat připojení otevřené po celou dobu, kdy chceš se Sparkem pracovat.

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

  • Načti balíček sparklyr pomocí library().
  • Připoj se ke Sparku voláním spark_connect() s argumentem master = "local". Výsledek ulož do proměnné spark_conn.
  • Zjisti verzi Sparku pomocí spark_version() s argumentem sc = spark_conn.
  • Odpoj se od Sparku pomocí spark_disconnect() s argumentem sc = spark_conn.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load sparklyr
___

# Connect to your Spark cluster
spark_conn <- ___

# Print the version of Spark
___

# Disconnect from Spark
___
Upravit a spustit kód