BaşlayınÜcretsiz başlayın

Spark veri türlerini keşfetmek

Bölüm 1'de, sparklyr'ın Spark üzerinde görebildiği DataFrame'leri listelemek için src_tbls() fonksiyonunu görmüştün. Ayrıca R tarafında bir tibble'ın sütunlarını keşfetmek için glimpse() fonksiyonunu da görmüştün.

sparklyr, R tarafında bir tibble'ın sütunlarını keşfetmek için sdf_schema() adlı bir fonksiyon sunar. Çağırması kolaydır; ama dönen değeriyle çalışmak biraz zahmetli olabilir.

sdf_schema(a_tibble)

Dönen değer bir listedir ve her öğe, her sütunun adını ve veri türünü içeren iki öğeli başka bir listedir. Bu egzersizde, veri türlerini daha rahat görebilmen için bir veri dönüşümü gösteriliyor.

Aşağıda R veri türlerinin Spark veri türlerine nasıl eşlendiğine dair bir karşılaştırma var. Diğer veri türleri şu anda sparklyr tarafından desteklenmiyor.

R type Spark type
logical BooleanType
numeric DoubleType
integer IntegerType
character StringType
list ArrayType

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta depolanan parça (track) meta verilerine bağlı bir tibble, track_metadata_tbl olarak önceden tanımlandı.

  • Parça meta verilerinin şemasını almak için sdf_schema() çağır.
  • Daha okunabilir bir tibble biçiminde görmek için schema üzerinde dönüşüm kodunu çalıştır.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Get the schema
(schema <- ___(___))

# Transform the schema
schema %>%
  lapply(function(x) do.call(data_frame, x)) %>%
  bind_rows()
Kodu Düzenle ve Çalıştır