Wzorzec połącz–pracuj–rozłącz
Praca z sparklyr jest bardzo podobna do pracy z dplyr, gdy dane znajdują się w bazie danych. W rzeczywistości sparklyr konwertuje kod R na kod SQL przed przekazaniem go do Sparka.
Typowy przepływ pracy składa się z trzech kroków:
- Połącz się ze Sparkiem za pomocą
spark_connect(). - Wykonaj pracę.
- Zamknij połączenie ze Sparkiem za pomocą
spark_disconnect().
W tym ćwiczeniu wykonasz najprostszą możliwą operację: zwrócisz wersję uruchomionego Sparka za pomocą spark_version().
spark_connect() przyjmuje URL wskazujący lokalizację Sparka. W przypadku klastra lokalnego (jak w tym ćwiczeniu) URL powinien być równy "local". W przypadku klastra zdalnego (na innej maszynie, zazwyczaj wydajnym serwerze) będzie to adres URL wraz z numerem portu.
spark_version() i spark_disconnect() przyjmują połączenie ze Sparkiem jako jedyny argument.
Jedna ważna uwaga: nawiązanie połączenia z klastrem zajmuje kilka sekund, dlatego regularne łączenie i rozłączanie jest niepraktyczne. W DataCamp musisz łączyć się na nowo przy każdym ćwiczeniu, ale gdy zaczniesz używać sparklyr we własnej pracy, najlepiej utrzymywać połączenie otwarte przez cały czas pracy ze Sparkiem.
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark z pakietem sparklyr w R
Instrukcje do ćwiczenia
- Załaduj pakiet
sparklyrza pomocąlibrary(). - Połącz się ze Sparkiem, wywołując
spark_connect()z argumentemmaster = "local". Przypisz wynik do zmiennejspark_conn. - Pobierz wersję Sparka za pomocą
spark_version()z argumentemsc = spark_conn. - Rozłącz się ze Sparkiem za pomocą
spark_disconnect()z argumentemsc = spark_conn.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___