Șablonul conectare-lucru-deconectare
Lucrul cu sparklyr seamănă foarte mult cu lucrul cu dplyr atunci când datele se află într-o bază de date. De fapt, sparklyr convertește codul tău R în cod SQL înainte de a-l transmite către Spark.
Fluxul de lucru tipic are trei pași:
- Conectează-te la Spark folosind
spark_connect(). - Efectuează operațiunile dorite.
- Închide conexiunea la Spark folosind
spark_disconnect().
În acest exercițiu, vei realiza cea mai simplă operațiune posibilă: returnarea versiunii de Spark care rulează, folosind spark_version().
spark_connect() primește un URL care indică locația Spark. Pentru un cluster local (cum rulezi tu acum), URL-ul trebuie să fie "local". Pentru un cluster la distanță (pe o altă mașină, de obicei un server de înaltă performanță), șirul de conectare va fi un URL împreună cu portul corespunzător.
spark_version() și spark_disconnect() primesc ambele conexiunea Spark ca unic argument.
O mică atenționare: conectarea la un cluster durează câteva secunde, așa că nu este practic să te conectezi și să te deconectezi în mod repetat. Deși trebuie să te reconectezi pentru fiecare exercițiu DataCamp, atunci când integrezi sparklyr în propriul tău flux de lucru, de obicei este mai bine să menții conexiunea deschisă pe toată durata în care vrei să lucrezi cu Spark.
Acest exercițiu face parte din cursul
Introducere în Spark cu sparklyr în R
Instrucțiuni pentru exercițiu
- Încarcă pachetul
sparklyrfolosindlibrary(). - Conectează-te la Spark apelând
spark_connect(), cu argumentulmaster = "local". Atribuie rezultatul variabileispark_conn. - Obține versiunea Spark folosind
spark_version(), cu argumentulsc = spark_conn. - Deconectează-te de la Spark folosind
spark_disconnect(), cu argumentulsc = spark_conn.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___