Изучение типов данных Spark
В главе 1 вы уже познакомились с src_tbls() — функцией для получения списка DataFrame на Spark, доступных для sparklyr. Вы также видели glimpse() для изучения столбцов тибла на стороне R.
В sparklyr есть функция sdf_schema() для изучения столбцов тибла на стороне R. Вызвать её просто, однако работа с возвращаемым значением требует некоторых усилий.
sdf_schema(a_tibble)
Функция возвращает список, каждый элемент которого — список из двух элементов: имя и тип данных столбца. В упражнении показано преобразование данных, которое позволяет удобнее просмотреть типы данных.
Ниже приведено соответствие типов данных R типам данных Spark. Другие типы данных в настоящее время не поддерживаются sparklyr.
| Тип R | Тип Spark |
|---|---|
| logical | BooleanType |
| numeric | DoubleType |
| integer | IntegerType |
| character | StringType |
| list | ArrayType |
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Инструкции к упражнению
Подключение к Spark создано заранее и доступно как spark_conn. Тибл, связанный с метаданными треков, хранящимися в Spark, предопределён как track_metadata_tbl.
- Вызовите
sdf_schema(), чтобы получить схему метаданных треков. - Запустите код преобразования для
schema, чтобы отобразить результат в более удобном формате тибла.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Get the schema
(schema <- ___(___))
# Transform the schema
schema %>%
lapply(function(x) do.call(data_frame, x)) %>%
bind_rows()