Zacznij terazZacznij za darmo

Eksploracja typów danych w Sparku

W rozdziale 1 poznałeś już src_tbls() – funkcję wyświetlającą listę DataFrame'ów w Sparku widocznych dla sparklyr. Znasz też glimpse(), która pozwala przejrzeć kolumny tibble po stronie R.

sparklyr udostępnia funkcję sdf_schema() do eksploracji kolumn tibble po stronie R. Wywołanie jej jest proste, choć praca z wartością zwracaną bywa nieco uciążliwa.

sdf_schema(a_tibble)

Wartość zwracana to lista, w której każdy element jest listą dwuelementową zawierającą nazwę i typ danych każdej kolumny. Ćwiczenie pokazuje transformację danych ułatwiającą podgląd typów.

Poniżej znajduje się zestawienie, jak typy danych R odpowiadają typom danych Sparka. Inne typy danych nie są obecnie obsługiwane przez sparklyr.

Typ R Typ Spark
logical BooleanType
numeric DoubleType
integer IntegerType
character StringType
list ArrayType

To ćwiczenie jest częścią kursu

Wprowadzenie do Spark z pakietem sparklyr w R

Zobacz kurs

Instrukcje do ćwiczenia

Połączenie ze Sparkiem zostało już utworzone i jest dostępne jako spark_conn. Tibble powiązane z metadanymi utworów przechowywanymi w Sparku zostało wcześniej zdefiniowane jako track_metadata_tbl.

  • Wywołaj sdf_schema(), aby pobrać schemat metadanych utworów.
  • Uruchom kod transformacji na obiekcie schema, aby wyświetlić go w czytelniejszym formacie tibble.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Get the schema
(schema <- ___(___))

# Transform the schema
schema %>%
  lapply(function(x) do.call(data_frame, x)) %>%
  bind_rows()
Edytuj i uruchom kod