Raccogliere i dati da Spark
Nell'esercizio "Esplorare la struttura delle tibbles", nel Capitolo 1, hai visto che le tibbles non memorizzano una copia dei dati. I dati restano in Spark e la tibble conserva semplicemente i dettagli di ciò che vorrebbe recuperare da Spark.
Ci sono molti motivi per cui potresti voler spostare i tuoi dati da Spark a R. Hai già visto che alcuni dati vengono spostati da Spark a R quando li stampi. Devi anche raccogliere il tuo insieme di dati se vuoi tracciarlo in un grafico o se vuoi usare una tecnica di modeling non disponibile in Spark. (Dopotutto, R ha la selezione più ampia di modelli disponibili tra tutti i linguaggi di programmazione.)
Per raccogliere i tuoi dati, cioè per spostarli da Spark a R, chiama collect().
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
È stata creata per te una connessione Spark come spark_conn. Una tibble collegata ai metadati delle tracce archiviati in Spark è stata predefinita come track_metadata_tbl.
- Filtra le righe di
track_metadata_tblin cuiartist_familiarityè maggiore di 0.9, assegnando i risultati aresults. - Stampa la classe di
results, notando che è unatbl_lazy(usata per dati remoti). - Raccogli i risultati, assegnandoli a
collected. - Stampa la classe di
collected, notando che è unatbl_df(usata per dati locali).
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
results <- track_metadata_tbl %>%
# Filter where artist familiarity is greater than 0.9
___
# Examine the class of the results
___
# Collect your results
collected <- results %>%
___
# Examine the class of the collected results
___