Kom igångKom igång gratis

Utforska Sparks datatyper

Du har redan sett (i kapitel 1) src_tbls() för att lista de DataFrames i Spark som sparklyr känner till. Du har också sett glimpse() för att utforska kolumnerna i en tibble på R-sidan.

sparklyr har en funktion som heter sdf_schema() för att utforska kolumnerna i en tibble på R-sidan. Den är enkel att anropa, men returvärdet kan vara lite krångligt att hantera.

sdf_schema(a_tibble)

Returvärdet är en lista där varje element i sin tur är en lista med två element – ett för kolumnnamnet och ett för datatypen. Övningen visar en datatransformation som gör det enklare att se datatyperna.

Här är en jämförelse av hur R-datatyper mappas till Spark-datatyper. Övriga datatyper stöds för närvarande inte av sparklyr.

R-typ Spark-typ
logical BooleanType
numeric DoubleType
integer IntegerType
character StringType
list ArrayType

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till spårmetadata lagrad i Spark har fördefinieras som track_metadata_tbl.

  • Anropa sdf_schema() för att hämta schemat för spårmetadatan.
  • Kör transformationskoden på schema för att visa den i ett mer lättläst tibble-format.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Get the schema
(schema <- ___(___))

# Transform the schema
schema %>%
  lapply(function(x) do.call(data_frame, x)) %>%
  bind_rows()
Redigera och kör kod