BaşlayınÜcretsiz başlayın

Büyük veri, minik tibble

Son egzersizde veriyi Spark’a kopyaladığında, copy_to() bir değer döndürmüştü. Bu dönüş değeri, kendi içinde veri barındırmayan özel bir tibble() türüdür. Bunu açıklamak için tidyverse paketlerinin veriyi nasıl sakladığı hakkında biraz bilgiye ihtiyacın var. Tibbles genelde, daha güzel bir yazdırma yöntemine sahip data.framelerin bir varyantıdır. Ancak dplyr, tibbles'ların uzak veri kaynaklarındaki (veritabanları gibi) veriyi ve – burada olduğu gibi – Spark verisini de temsil etmesine izin verir. Uzak veri kümeleri için tibble nesnesi, yalnızca uzak veriye olan bağlantıyı saklar. Bu konuya daha sonra ayrıntılı olarak değineceğiz; ancak şimdilik önemli nokta şu: Veri kümen büyük olsa bile tibble nesnesinin boyutu küçüktür.

Spark tarafında veriler DataFrame adı verilen bir değişkende saklanır. Bu, R’nin data.frame türünün aşağı yukarı birebir karşılığıdır. (Yine de sütun türlerinin adları biraz farklıdır – örneğin numeric sütunlar DoubleType olarak adlandırılır.) Kurs boyunca, data.frame ile DataFrame ayrımı gerekmedikçe, data frame terimi kullanılacaktır. Bu tür yapılar veritabanı tablolarına da benzediği için, zaman zaman bu tür dikdörtgen veriyi anlatmak için tablo terimini de kullanacağız.

tbl() fonksiyonunu bir Spark bağlantısı ve Spark data frame’inin adını veren bir karakter dizisiyle çağırmak, copy_to() kullandığında dönenle aynı tibble nesnesini döndürür.

Bu egzersizde göreceğin faydalı araçlardan biri de pryr paketindeki object_size() fonksiyonudur. Bu fonksiyon, bir nesnenin bellekte ne kadar yer kapladığını gösterir.

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

spark_conn adıyla bir Spark bağlantısı senin için oluşturuldu. 1.000 parçaya ait parça metaverileri Spark kümesinde "track_metadata" tablosunda saklanıyor.

  • tbl() ile "track_metadata" tablosuna bağlan. Sonucu track_metadata_tbl değişkenine ata.
  • track_metadata_tbl üzerinde dim() kullanarak veri kümesinin ne kadar büyük olduğuna bak.
  • track_metadata_tbl üzerinde object_size() kullanarak tibble’ın ne kadar küçük olduğuna bak.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Link to the track_metadata table in Spark
track_metadata_tbl <- ___(___, "___")

# See how big the dataset is
___(___)

# See how small the tibble is
___(___)
Kodu Düzenle ve Çalıştır