Inizia subitoInizia gratis

Esplorare i tipi di dati di Spark

Hai già visto (nel Capitolo 1) src_tbls() per elencare i DataFrame su Spark che sparklyr può vedere. Hai anche visto glimpse() per esplorare le colonne di una tibble sul lato R.

sparklyr ha una funzione chiamata sdf_schema() per esplorare le colonne di una tibble sul lato R. È semplice da chiamare; è un po' scomodo gestire il valore restituito.

sdf_schema(a_tibble)

Il valore restituito è una lista, e ogni elemento è una lista con due elementi, che contengono il nome e il tipo di dato di ciascuna colonna. L'esercizio mostra una trasformazione dei dati per visualizzare più facilmente i tipi di dato.

Ecco un confronto tra come i tipi di dato di R corrispondono ai tipi di dato di Spark. Altri tipi di dato non sono attualmente supportati da sparklyr.

R type Spark type
logical BooleanType
numeric DoubleType
integer IntegerType
character StringType
list ArrayType

Questo esercizio fa parte del corso

Introduzione a Spark con sparklyr in R

Visualizza corso

Istruzioni dell'esercizio

È stata creata per te una connessione Spark come spark_conn. Una tibble collegata ai metadati delle tracce archiviati in Spark è stata predefinita come track_metadata_tbl.

  • Chiama sdf_schema() per ottenere lo schema dei metadati delle tracce.
  • Esegui il codice di trasformazione su schema per vederlo in un formato tibble più leggibile.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Get the schema
(schema <- ___(___))

# Transform the schema
schema %>%
  lapply(function(x) do.call(data_frame, x)) %>%
  bind_rows()
Modifica ed esegui il codice