Lo schema connetti-lavora-disconnetti
Lavorare con sparklyr è molto simile a lavorare con dplyr quando i dati sono in un database. Infatti, sparklyr converte il tuo codice R in codice SQL prima di passarlo a Spark.
Il flusso di lavoro tipico prevede tre passaggi:
- Connettiti a Spark usando
spark_connect(). - Svolgi il lavoro.
- Chiudi la connessione a Spark usando
spark_disconnect().
In questo esercizio farai l’operazione più semplice possibile: restituire la versione di Spark in esecuzione, usando spark_version().
spark_connect() accetta un URL che indica dove si trova Spark. Per un cluster locale (come quello che stai eseguendo), l’URL deve essere "local". Per un cluster remoto (su un’altra macchina, di solito un server ad alte prestazioni), la stringa di connessione sarà un URL e una porta a cui connettersi.
spark_version() e spark_disconnect() accettano entrambe la connessione a Spark come unico argomento.
Una parola di avviso. Connettersi a un cluster richiede diversi secondi, quindi non è pratico connettersi e disconnettersi di continuo. Anche se in ogni esercizio di DataCamp devi riconnetterti, quando inserisci sparklyr nel tuo flusso di lavoro è di solito meglio mantenere aperta la connessione per tutto il tempo in cui lavori con Spark.
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
- Carica il pacchetto
sparklyrconlibrary(). - Connettiti a Spark chiamando
spark_connect()con l’argomentomaster = "local". Assegna il risultato aspark_conn. - Ottieni la versione di Spark usando
spark_version()con l’argomentosc = spark_conn. - Disconnettiti da Spark usando
spark_disconnect()con l’argomentosc = spark_conn.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___