НачатьНачать бесплатно

Изучение типов данных Spark

В главе 1 вы уже познакомились с src_tbls() — функцией для получения списка DataFrame на Spark, доступных для sparklyr. Вы также видели glimpse() для изучения столбцов тибла на стороне R.

В sparklyr есть функция sdf_schema() для изучения столбцов тибла на стороне R. Вызвать её просто, однако работа с возвращаемым значением требует некоторых усилий.

sdf_schema(a_tibble)

Функция возвращает список, каждый элемент которого — список из двух элементов: имя и тип данных столбца. В упражнении показано преобразование данных, которое позволяет удобнее просмотреть типы данных.

Ниже приведено соответствие типов данных R типам данных Spark. Другие типы данных в настоящее время не поддерживаются sparklyr.

Тип R Тип Spark
logical BooleanType
numeric DoubleType
integer IntegerType
character StringType
list ArrayType

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

Подключение к Spark создано заранее и доступно как spark_conn. Тибл, связанный с метаданными треков, хранящимися в Spark, предопределён как track_metadata_tbl.

  • Вызовите sdf_schema(), чтобы получить схему метаданных треков.
  • Запустите код преобразования для schema, чтобы отобразить результат в более удобном формате тибла.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Get the schema
(schema <- ___(___))

# Transform the schema
schema %>%
  lapply(function(x) do.call(data_frame, x)) %>%
  bind_rows()
Редактировать и запускать код