ÎncepețiÎncepe gratuit

Explorarea tipurilor de date Spark

Ai văzut deja (în Capitolul 1) src_tbls() pentru listarea DataFrame-urilor din Spark pe care sparklyr le poate accesa. Ai folosit și glimpse() pentru a explora coloanele unui tibble din partea R.

sparklyr are o funcție numită sdf_schema() pentru a explora coloanele unui tibble din partea R. Este ușor de apelat, dar valoarea returnată poate fi un pic mai dificil de interpretat.

sdf_schema(a_tibble)

Valoarea returnată este o listă, iar fiecare element este la rândul său o listă cu două elemente, conținând numele și tipul de date al fiecărei coloane. Exercițiul include o transformare a datelor pentru a vizualiza mai ușor tipurile de date.

Iată o comparație între tipurile de date din R și cele din Spark. Alte tipuri de date nu sunt suportate în prezent de sparklyr.

Tip R Tip Spark
logical BooleanType
numeric DoubleType
integer IntegerType
character StringType
list ArrayType

Acest exercițiu face parte din cursul

Introducere în Spark cu sparklyr în R

Vezi cursul

Instrucțiuni pentru exercițiu

O conexiune Spark a fost creată pentru tine ca spark_conn. Un tibble atașat la metadatele pistelor stocate în Spark a fost predefinit ca track_metadata_tbl.

  • Apelează sdf_schema() pentru a obține schema metadatelor pistelor.
  • Rulează codul de transformare pe schema pentru a-l vizualiza într-un format tibble mai ușor de citit.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Get the schema
(schema <- ___(___))

# Transform the schema
schema %>%
  lapply(function(x) do.call(data_frame, x)) %>%
  bind_rows()
Editează și rulează codul