Veriyi Spark'tan geri toplama
- Bölümdeki 'tibble'ların yapısını keşfetme egzersizinde, tibble'ların verinin bir kopyasını saklamadığını görmüştün. Veri Spark'ta kalır; tibble ise Spark'tan hangi verileri almak istediğine dair ayrıntıları saklar.
Verini Spark'tan R'a taşımak istemenin birçok nedeni olabilir. Yazdırdığında bazı verilerin Spark'tan R'a nasıl taşındığını zaten gördün. Ayrıca veri kümeni görselleştirmek istediğinde ya da Spark'ta bulunmayan bir modelleme tekniğini kullanmak istediğinde de veriyi toplaman gerekir. (Sonuçta, R herhangi bir programlama dilinin sunduğu en geniş model yelpazesine sahiptir.)
Verini toplamak, yani Spark'tan R'a taşımak için collect() çağrısını kullanırsın.
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
Senin için spark_conn adıyla bir Spark bağlantısı oluşturuldu. Spark'ta saklanan parça (track) metadatasına bağlı bir tibble track_metadata_tbl olarak önceden tanımlandı.
track_metadata_tbliçindeki satırlarıartist_familiarity0.9'dan büyük olacak şekilde filtrele ve sonucuresultsdeğişkenine ata.results'ın sınıfını yazdır; bunun birtbl_lazy(uzak veri için kullanılır) olduğunu not et.- Sonuçlarını topla ve
collecteddeğişkenine ata. collected'ın sınıfını yazdır; bunun birtbl_df(yerel veri için kullanılır) olduğunu not et.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
results <- track_metadata_tbl %>%
# Filter where artist familiarity is greater than 0.9
___
# Examine the class of the results
___
# Collect your results
collected <- results %>%
___
# Examine the class of the collected results
___