Explorarea tipurilor de date Spark
Ai văzut deja (în Capitolul 1) src_tbls() pentru listarea DataFrame-urilor din Spark pe care sparklyr le poate accesa. Ai folosit și glimpse() pentru a explora coloanele unui tibble din partea R.
sparklyr are o funcție numită sdf_schema() pentru a explora coloanele unui tibble din partea R. Este ușor de apelat, dar valoarea returnată poate fi un pic mai dificil de interpretat.
sdf_schema(a_tibble)
Valoarea returnată este o listă, iar fiecare element este la rândul său o listă cu două elemente, conținând numele și tipul de date al fiecărei coloane. Exercițiul include o transformare a datelor pentru a vizualiza mai ușor tipurile de date.
Iată o comparație între tipurile de date din R și cele din Spark. Alte tipuri de date nu sunt suportate în prezent de sparklyr.
| Tip R | Tip Spark |
|---|---|
| logical | BooleanType |
| numeric | DoubleType |
| integer | IntegerType |
| character | StringType |
| list | ArrayType |
Acest exercițiu face parte din cursul
Introducere în Spark cu sparklyr în R
Instrucțiuni pentru exercițiu
O conexiune Spark a fost creată pentru tine ca spark_conn. Un tibble atașat la metadatele pistelor stocate în Spark a fost predefinit ca track_metadata_tbl.
- Apelează
sdf_schema()pentru a obține schema metadatelor pistelor. - Rulează codul de transformare pe
schemapentru a-l vizualiza într-un format tibble mai ușor de citit.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Get the schema
(schema <- ___(___))
# Transform the schema
schema %>%
lapply(function(x) do.call(data_frame, x)) %>%
bind_rows()