Esplorare i tipi di dati di Spark
Hai già visto (nel Capitolo 1) src_tbls() per elencare i DataFrame su Spark che sparklyr può vedere. Hai anche visto glimpse() per esplorare le colonne di una tibble sul lato R.
sparklyr ha una funzione chiamata sdf_schema() per esplorare le colonne di una tibble sul lato R. È semplice da chiamare; è un po' scomodo gestire il valore restituito.
sdf_schema(a_tibble)
Il valore restituito è una lista, e ogni elemento è una lista con due elementi, che contengono il nome e il tipo di dato di ciascuna colonna. L'esercizio mostra una trasformazione dei dati per visualizzare più facilmente i tipi di dato.
Ecco un confronto tra come i tipi di dato di R corrispondono ai tipi di dato di Spark. Altri tipi di dato non sono attualmente supportati da sparklyr.
| R type | Spark type |
|---|---|
| logical | BooleanType |
| numeric | DoubleType |
| integer | IntegerType |
| character | StringType |
| list | ArrayType |
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
È stata creata per te una connessione Spark come spark_conn. Una tibble collegata ai metadati delle tracce archiviati in Spark è stata predefinita come track_metadata_tbl.
- Chiama
sdf_schema()per ottenere lo schema dei metadati delle tracce. - Esegui il codice di trasformazione su
schemaper vederlo in un formato tibble più leggibile.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Get the schema
(schema <- ___(___))
# Transform the schema
schema %>%
lapply(function(x) do.call(data_frame, x)) %>%
bind_rows()