Začněte nyníZačněte zdarma

Prozkoumání datových typů ve Sparku

Už jsi viděl/a (v 1. kapitole) funkci src_tbls() pro výpis DataFramů ve Sparku, které sparklyr vidí. Stejně tak funkci glimpse() pro prozkoumání sloupců tibble na straně R.

sparklyr nabízí funkci sdf_schema() pro prozkoumání sloupců tibble na straně R. Volání je jednoduché, ale práce s návratovou hodnotou může být trochu zdlouhavá.

sdf_schema(a_tibble)

Návratová hodnota je seznam, kde každý prvek je také seznam se dvěma položkami obsahujícími název a datový typ každého sloupce. Cvičení ukazuje datovou transformaci pro přehlednější zobrazení datových typů.

Níže je přehled toho, jak se datové typy R mapují na datové typy Sparku. Ostatní datové typy sparklyr momentálně nepodporuje.

Typ v R Typ ve Sparku
logical BooleanType
numeric DoubleType
integer IntegerType
character StringType
list ArrayType

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

Spark připojení je pro tebe připraveno jako spark_conn. Tibble napojené na metadata skladeb uložená ve Sparku je předdefinováno jako track_metadata_tbl.

  • Zavolej sdf_schema(), abys získal/a schéma metadat skladeb.
  • Spusť transformační kód na objektu schema, aby se zobrazil v přehlednějším formátu tibble.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Get the schema
(schema <- ___(___))

# Transform the schema
schema %>%
  lapply(function(x) do.call(data_frame, x)) %>%
  bind_rows()
Upravit a spustit kód