Inizia subitoInizia gratis

Lo schema connetti-lavora-disconnetti

Lavorare con sparklyr è molto simile a lavorare con dplyr quando i dati sono in un database. Infatti, sparklyr converte il tuo codice R in codice SQL prima di passarlo a Spark.

Il flusso di lavoro tipico prevede tre passaggi:

  1. Connettiti a Spark usando spark_connect().
  2. Svolgi il lavoro.
  3. Chiudi la connessione a Spark usando spark_disconnect().

In questo esercizio farai l’operazione più semplice possibile: restituire la versione di Spark in esecuzione, usando spark_version().

spark_connect() accetta un URL che indica dove si trova Spark. Per un cluster locale (come quello che stai eseguendo), l’URL deve essere "local". Per un cluster remoto (su un’altra macchina, di solito un server ad alte prestazioni), la stringa di connessione sarà un URL e una porta a cui connettersi.

spark_version() e spark_disconnect() accettano entrambe la connessione a Spark come unico argomento.

Una parola di avviso. Connettersi a un cluster richiede diversi secondi, quindi non è pratico connettersi e disconnettersi di continuo. Anche se in ogni esercizio di DataCamp devi riconnetterti, quando inserisci sparklyr nel tuo flusso di lavoro è di solito meglio mantenere aperta la connessione per tutto il tempo in cui lavori con Spark.

Questo esercizio fa parte del corso

Introduzione a Spark con sparklyr in R

Visualizza corso

Istruzioni dell'esercizio

  • Carica il pacchetto sparklyr con library().
  • Connettiti a Spark chiamando spark_connect() con l’argomento master = "local". Assegna il risultato a spark_conn.
  • Ottieni la versione di Spark usando spark_version() con l’argomento sc = spark_conn.
  • Disconnettiti da Spark usando spark_disconnect() con l’argomento sc = spark_conn.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Load sparklyr
___

# Connect to your Spark cluster
spark_conn <- ___

# Print the version of Spark
___

# Disconnect from Spark
___
Modifica ed esegui il codice