Inizia subitoInizia gratis

Raccogliere i dati da Spark

Nell'esercizio "Esplorare la struttura delle tibbles", nel Capitolo 1, hai visto che le tibbles non memorizzano una copia dei dati. I dati restano in Spark e la tibble conserva semplicemente i dettagli di ciò che vorrebbe recuperare da Spark.

Ci sono molti motivi per cui potresti voler spostare i tuoi dati da Spark a R. Hai già visto che alcuni dati vengono spostati da Spark a R quando li stampi. Devi anche raccogliere il tuo insieme di dati se vuoi tracciarlo in un grafico o se vuoi usare una tecnica di modeling non disponibile in Spark. (Dopotutto, R ha la selezione più ampia di modelli disponibili tra tutti i linguaggi di programmazione.)

Per raccogliere i tuoi dati, cioè per spostarli da Spark a R, chiama collect().

Questo esercizio fa parte del corso

Introduzione a Spark con sparklyr in R

Visualizza corso

Istruzioni dell'esercizio

È stata creata per te una connessione Spark come spark_conn. Una tibble collegata ai metadati delle tracce archiviati in Spark è stata predefinita come track_metadata_tbl.

  • Filtra le righe di track_metadata_tbl in cui artist_familiarity è maggiore di 0.9, assegnando i risultati a results.
  • Stampa la classe di results, notando che è una tbl_lazy (usata per dati remoti).
  • Raccogli i risultati, assegnandoli a collected.
  • Stampa la classe di collected, notando che è una tbl_df (usata per dati locali).

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

results <- track_metadata_tbl %>%
  # Filter where artist familiarity is greater than 0.9
  ___

# Examine the class of the results
___

# Collect your results
collected <- results %>%
  ___

# Examine the class of the collected results
___
Modifica ed esegui il codice