Mönstret anslut–arbeta–koppla från
Att arbeta med sparklyr påminner mycket om att arbeta med dplyr när data finns i en databas. I praktiken konverterar sparklyr din R-kod till SQL-kod innan den skickas vidare till Spark.
Det typiska arbetsflödet består av tre steg:
- Anslut till Spark med
spark_connect(). - Utför arbetet.
- Stäng anslutningen till Spark med
spark_disconnect().
I den här övningen utför du den enklaste tänkbara uppgiften: att returnera vilken version av Spark som körs, med hjälp av spark_version().
spark_connect() tar en URL som anger var Spark finns. För ett lokalt kluster (som du kör nu) ska URL:en vara "local". För ett fjärrkluster (på en annan maskin, vanligtvis en server med hög kapacitet) anges en URL med port att ansluta till.
spark_version() och spark_disconnect() tar båda Spark-anslutningen som enda argument.
Ett tips att ha i åtanke: att ansluta till ett kluster tar flera sekunder, så det är opraktiskt att ansluta och koppla från upprepade gånger. Du behöver ansluta på nytt för varje DataCamp-övning, men när du använder sparklyr i ditt eget arbetsflöde är det oftast bäst att hålla anslutningen öppen under hela den tid du vill arbeta med Spark.
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
- Läs in paketet
sparklyrmedlibrary(). - Anslut till Spark genom att anropa
spark_connect()med argumentetmaster = "local". Tilldela resultatet tillspark_conn. - Hämta Spark-versionen med
spark_version()och argumentetsc = spark_conn. - Koppla från Spark med
spark_disconnect()och argumentetsc = spark_conn.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___