BaşlayınÜcretsiz başlayın

Veriyi Spark'tan geri toplama

  1. Bölümdeki 'tibble'ların yapısını keşfetme egzersizinde, tibble'ların verinin bir kopyasını saklamadığını görmüştün. Veri Spark'ta kalır; tibble ise Spark'tan hangi verileri almak istediğine dair ayrıntıları saklar.

Verini Spark'tan R'a taşımak istemenin birçok nedeni olabilir. Yazdırdığında bazı verilerin Spark'tan R'a nasıl taşındığını zaten gördün. Ayrıca veri kümeni görselleştirmek istediğinde ya da Spark'ta bulunmayan bir modelleme tekniğini kullanmak istediğinde de veriyi toplaman gerekir. (Sonuçta, R herhangi bir programlama dilinin sunduğu en geniş model yelpazesine sahiptir.)

Verini toplamak, yani Spark'tan R'a taşımak için collect() çağrısını kullanırsın.

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

Senin için spark_conn adıyla bir Spark bağlantısı oluşturuldu. Spark'ta saklanan parça (track) metadatasına bağlı bir tibble track_metadata_tbl olarak önceden tanımlandı.

  • track_metadata_tbl içindeki satırları artist_familiarity 0.9'dan büyük olacak şekilde filtrele ve sonucu results değişkenine ata.
  • results'ın sınıfını yazdır; bunun bir tbl_lazy (uzak veri için kullanılır) olduğunu not et.
  • Sonuçlarını topla ve collected değişkenine ata.
  • collected'ın sınıfını yazdır; bunun bir tbl_df (yerel veri için kullanılır) olduğunu not et.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

results <- track_metadata_tbl %>%
  # Filter where artist familiarity is greater than 0.9
  ___

# Examine the class of the results
___

# Collect your results
collected <- results %>%
  ___

# Examine the class of the collected results
___
Kodu Düzenle ve Çalıştır