Kom igångKom igång gratis

Mönstret anslut–arbeta–koppla från

Att arbeta med sparklyr påminner mycket om att arbeta med dplyr när data finns i en databas. I praktiken konverterar sparklyr din R-kod till SQL-kod innan den skickas vidare till Spark.

Det typiska arbetsflödet består av tre steg:

  1. Anslut till Spark med spark_connect().
  2. Utför arbetet.
  3. Stäng anslutningen till Spark med spark_disconnect().

I den här övningen utför du den enklaste tänkbara uppgiften: att returnera vilken version av Spark som körs, med hjälp av spark_version().

spark_connect() tar en URL som anger var Spark finns. För ett lokalt kluster (som du kör nu) ska URL:en vara "local". För ett fjärrkluster (på en annan maskin, vanligtvis en server med hög kapacitet) anges en URL med port att ansluta till.

spark_version() och spark_disconnect() tar båda Spark-anslutningen som enda argument.

Ett tips att ha i åtanke: att ansluta till ett kluster tar flera sekunder, så det är opraktiskt att ansluta och koppla från upprepade gånger. Du behöver ansluta på nytt för varje DataCamp-övning, men när du använder sparklyr i ditt eget arbetsflöde är det oftast bäst att hålla anslutningen öppen under hela den tid du vill arbeta med Spark.

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

  • Läs in paketet sparklyr med library().
  • Anslut till Spark genom att anropa spark_connect() med argumentet master = "local". Tilldela resultatet till spark_conn.
  • Hämta Spark-versionen med spark_version() och argumentet sc = spark_conn.
  • Koppla från Spark med spark_disconnect() och argumentet sc = spark_conn.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load sparklyr
___

# Connect to your Spark cluster
spark_conn <- ___

# Print the version of Spark
___

# Disconnect from Spark
___
Redigera och kör kod