Veriyi Spark'a kopyalama
Spark ile gerçek bir iş yapmadan önce, veriyi Spark'a aktarman gerekir. sparklyr, bir CSV dosyasını Spark'a okumak için spark_read_csv() gibi bazı işlevler sunar. Daha genel olarak, veriyi R'den Spark'a kopyalayabilmek çok işe yarar. Bu, dplyr'ın copy_to() işleviyle yapılır. Uyaralım: veri kopyalama doğası gereği yavaştır. Hatta büyük veri kümeleriyle çalışırken performansı iyileştirme stratejilerinin önemli bir kısmı, veriyi bir yerden başka bir yere kopyalamaktan kaçınmanın yollarını bulmaktır.
copy_to() iki argüman alır: bir Spark bağlantısı (dest) ve Spark'a kopyalanacak bir veri çerçevesi (df).
Verini Spark'a kopyaladıktan sonra, işlemin gerçekten başarılı olduğundan emin olmak isteyebilirsin. Spark'ta depolanan tüm veri çerçevelerinin bir listesini, yalnızca bir Spark bağlantısı argümanı (x) alan src_tbls() ile görebilirsin.
Kurs boyunca, Million Song Dataset içindeki parça üst verilerini keşfedeceksin. Spark milyonlarca satırı rahatça ölçekleyebilse de işleri basit ve akıcı tutmak için bin parçalık bir alt küme kullanacaksın. Terminolojiyi netleştirelim: bir “parça” veri kümesindeki bir satıra karşılık gelir. Senin bin parçalık veri kümen için bu, “şarkı” ile aynı şeydir (tam milyon satırlık veri kümesinde bazı yinelenen şarkılar bulunuyordu).
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
1.000 parçaya ait şarkı adı, sanatçı adı ve diğer üst verileri içeren track_metadata, çalışma alanında önceden tanımlandı.
track_metadataveri kümesini keşfetmek içinstr()kullan.- Yerel Spark kümesine bağlan ve bağlantıyı
spark_conniçinde sakla. copy_to()kullanaraktrack_metadata'i Spark kümesine kopyala.- Spark'ta hangi veri çerçevelerinin mevcut olduğuna
src_tbls()ile bak. - Spark bağlantısını kapat.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Load dplyr
___
# Explore track_metadata structure
___
# Connect to your Spark cluster
spark_conn <- spark_connect("___")
# Copy track_metadata to Spark
track_metadata_tbl <- ___(___, ___, overwrite = TRUE)
# List the data frames available in Spark
___(___)
# Disconnect from Spark
spark_disconnect(___)