Eksploracja typów danych w Sparku
W rozdziale 1 poznałeś już src_tbls() – funkcję wyświetlającą listę DataFrame'ów w Sparku widocznych dla sparklyr. Znasz też glimpse(), która pozwala przejrzeć kolumny tibble po stronie R.
sparklyr udostępnia funkcję sdf_schema() do eksploracji kolumn tibble po stronie R. Wywołanie jej jest proste, choć praca z wartością zwracaną bywa nieco uciążliwa.
sdf_schema(a_tibble)
Wartość zwracana to lista, w której każdy element jest listą dwuelementową zawierającą nazwę i typ danych każdej kolumny. Ćwiczenie pokazuje transformację danych ułatwiającą podgląd typów.
Poniżej znajduje się zestawienie, jak typy danych R odpowiadają typom danych Sparka. Inne typy danych nie są obecnie obsługiwane przez sparklyr.
| Typ R | Typ Spark |
|---|---|
| logical | BooleanType |
| numeric | DoubleType |
| integer | IntegerType |
| character | StringType |
| list | ArrayType |
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark z pakietem sparklyr w R
Instrukcje do ćwiczenia
Połączenie ze Sparkiem zostało już utworzone i jest dostępne jako spark_conn. Tibble powiązane z metadanymi utworów przechowywanymi w Sparku zostało wcześniej zdefiniowane jako track_metadata_tbl.
- Wywołaj
sdf_schema(), aby pobrać schemat metadanych utworów. - Uruchom kod transformacji na obiekcie
schema, aby wyświetlić go w czytelniejszym formacie tibble.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Get the schema
(schema <- ___(___))
# Transform the schema
schema %>%
lapply(function(x) do.call(data_frame, x)) %>%
bind_rows()