Fatti l'uno per l'altro
R ti permette di scrivere codice per l’analisi dei dati in modo rapido. Con un po’ di attenzione, puoi anche renderlo facile da leggere, così da mantenerlo con semplicità. In molti casi, R è anche abbastanza veloce nell’esecuzione del codice.
Purtroppo, R richiede che tutti i dati da analizzare stiano in memoria (RAM) su una singola macchina. Questo limita la quantità di dati che puoi analizzare con R. Esistono alcune soluzioni a questo problema, tra cui l’uso di Spark.
Spark è una piattaforma open source per il calcolo su cluster. Significa che puoi distribuire dati e calcoli su più macchine, arrivando di fatto ad analizzare una quantità di dati virtualmente illimitata. Le due tecnologie si completano a vicenda. Usando R e Spark insieme puoi scrivere codice in fretta e farlo girare in fretta!
sparklyr è un pacchetto R che ti permette di scrivere codice R per lavorare con i dati in un cluster Spark. Offre un’interfaccia dplyr, il che significa che puoi scrivere (più o meno) lo stesso codice R in stile dplyr, sia che tu stia lavorando con dati sulla tua macchina sia su un cluster Spark.
Urla se vuoi andare più veloce!
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
esercizio interattivo pratico
Trasforma la teoria in pratica con uno dei nostri esercizi interattivi
Inizia esercizio