Utforska Sparks datatyper
Du har redan sett (i kapitel 1) src_tbls() för att lista de DataFrames i Spark som sparklyr känner till. Du har också sett glimpse() för att utforska kolumnerna i en tibble på R-sidan.
sparklyr har en funktion som heter sdf_schema() för att utforska kolumnerna i en tibble på R-sidan. Den är enkel att anropa, men returvärdet kan vara lite krångligt att hantera.
sdf_schema(a_tibble)
Returvärdet är en lista där varje element i sin tur är en lista med två element – ett för kolumnnamnet och ett för datatypen. Övningen visar en datatransformation som gör det enklare att se datatyperna.
Här är en jämförelse av hur R-datatyper mappas till Spark-datatyper. Övriga datatyper stöds för närvarande inte av sparklyr.
| R-typ | Spark-typ |
|---|---|
| logical | BooleanType |
| numeric | DoubleType |
| integer | IntegerType |
| character | StringType |
| list | ArrayType |
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark har fördefinieras som track_metadata_tbl.
- Anropa
sdf_schema()för att hämta schemat för spårmetadatan. - Kör transformationskoden på
schemaför att visa den i ett mer lättläst tibble-format.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Get the schema
(schema <- ___(___))
# Transform the schema
schema %>%
lapply(function(x) do.call(data_frame, x)) %>%
bind_rows()