Prozkoumání datových typů ve Sparku
Už jsi viděl/a (v 1. kapitole) funkci src_tbls() pro výpis DataFramů ve Sparku, které sparklyr vidí. Stejně tak funkci glimpse() pro prozkoumání sloupců tibble na straně R.
sparklyr nabízí funkci sdf_schema() pro prozkoumání sloupců tibble na straně R. Volání je jednoduché, ale práce s návratovou hodnotou může být trochu zdlouhavá.
sdf_schema(a_tibble)
Návratová hodnota je seznam, kde každý prvek je také seznam se dvěma položkami obsahujícími název a datový typ každého sloupce. Cvičení ukazuje datovou transformaci pro přehlednější zobrazení datových typů.
Níže je přehled toho, jak se datové typy R mapují na datové typy Sparku. Ostatní datové typy sparklyr momentálně nepodporuje.
| Typ v R | Typ ve Sparku |
|---|---|
| logical | BooleanType |
| numeric | DoubleType |
| integer | IntegerType |
| character | StringType |
| list | ArrayType |
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
Spark připojení je pro tebe připraveno jako spark_conn. Tibble napojené na metadata skladeb uložená ve Sparku je předdefinováno jako track_metadata_tbl.
- Zavolej
sdf_schema(), abys získal/a schéma metadat skladeb. - Spusť transformační kód na objektu
schema, aby se zobrazil v přehlednějším formátu tibble.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Get the schema
(schema <- ___(___))
# Transform the schema
schema %>%
lapply(function(x) do.call(data_frame, x)) %>%
bind_rows()