Tibble'ların yapısını keşfetmek
Spark'ta saklanan verileri tanımlayan bir tibble'ı yazdırmayı denersen, biraz sihir gerekir; çünkü tibble verinin bir kopyasını kendi içinde tutmaz. Sihir şu: print yöntemi Spark bağlantını kullanır, içeriğin bir kısmını R'a geri kopyalar ve sanki veri yerelde saklanıyormuş gibi bu değerleri gösterir. Bu bölümün başlarında gördüğün gibi, veri kopyalamak yavaştır; bu yüzden varsayılan olarak yalnızca ekrana sığacak 10 satır ve olabildiğince çok sütun yazdırılır.
print() fonksiyonuna n argümanını vererek yazdırılan satır sayısını değiştirebilirsin. Görüntülenecek içeriğin genişliğini, sütun sayısı değil karakter sayısı cinsinden belirtilen width argümanıyla da ayarlayabilirsin. Güzel bir püf noktası, tüm sütunları yazdırmak için width = Inf kullanmaktır.
str() fonksiyonu genellikle bir değişkenin yapısını göstermek için kullanılır. data.frameler için her sütunun türünü ve ilk birkaç değerini içeren güzel bir özet verir. Ancak uzak veri kaynağına sahip tibble'lar için str() veriyi nasıl getireceğini bilmez. Yani Spark'ta saklanan verileri içeren bir tibble üzerinde str() çağırırsan, bir Spark bağlantı nesnesi ve birkaç başka parça içeren bir liste görürsün.
Tibble'ın atıfta bulunduğu veri kümesinde her sütunun ne içerdiğine dair bir özet görmek istiyorsan bunun yerine glimpse() çağırman gerekir. Uzak veriler (örneğin bir Spark kümesinde saklanan veri kümeleri) için satır sayısının yanıltıcı olabileceğini unutma! Bu durumda glimpse() satır sayısını doğru şekilde raporlayamayabilir.
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
spark_conn olarak bir Spark bağlantısı senin için oluşturuldu. Spark'ta saklanan parça meta verilerine bağlı bir tibble track_metadata_tbl olarak önceden tanımlandı.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Print 5 rows, all columns
___
# Examine structure of tibble
___
# Examine structure of data
___