Spark veri türlerini keşfetmek
Bölüm 1'de, sparklyr'ın Spark üzerinde görebildiği DataFrame'leri listelemek için src_tbls() fonksiyonunu görmüştün. Ayrıca R tarafında bir tibble'ın sütunlarını keşfetmek için glimpse() fonksiyonunu da görmüştün.
sparklyr, R tarafında bir tibble'ın sütunlarını keşfetmek için sdf_schema() adlı bir fonksiyon sunar. Çağırması kolaydır; ama dönen değeriyle çalışmak biraz zahmetli olabilir.
sdf_schema(a_tibble)
Dönen değer bir listedir ve her öğe, her sütunun adını ve veri türünü içeren iki öğeli başka bir listedir. Bu egzersizde, veri türlerini daha rahat görebilmen için bir veri dönüşümü gösteriliyor.
Aşağıda R veri türlerinin Spark veri türlerine nasıl eşlendiğine dair bir karşılaştırma var. Diğer veri türleri şu anda sparklyr tarafından desteklenmiyor.
| R type | Spark type |
|---|---|
| logical | BooleanType |
| numeric | DoubleType |
| integer | IntegerType |
| character | StringType |
| list | ArrayType |
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta depolanan parça (track) meta verilerine bağlı bir tibble, track_metadata_tbl olarak önceden tanımlandı.
- Parça meta verilerinin şemasını almak için
sdf_schema()çağır. - Daha okunabilir bir tibble biçiminde görmek için
schemaüzerinde dönüşüm kodunu çalıştır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Get the schema
(schema <- ___(___))
# Transform the schema
schema %>%
lapply(function(x) do.call(data_frame, x)) %>%
bind_rows()