Örnekleme ile veriyi küçültme
Büyük bir veri kümesiyle çalışırken, genellikle her zaman tamamıyla çalışmana gerek yoktur. Özellikle projenin başında, ne yapmak istediğini denerken ve keşfederken, verinin daha küçük bir alt kümesiyle çalışarak daha hızlı yineleme yapabilirsin. sdf_sample() bunu yapmanın kullanışlı bir yolunu sunar. Bir tibble ve döndürülecek satırların oranını alır. Bu durumda, yerine koymadan örnekleme yapmak istiyorsun. Veri kümenin onda birinin rastgele bir örneğini almak için aşağıdaki kodu kullanırsın.
a_tibble %>%
sdf_sample(fraction = 0.1, replacement = FALSE)
Örneklemenin sonuçları rastgele olduğundan ve küçültülmüş veri kümesini yeniden kullanmak isteyebileceğinden, sonuçları başka bir Spark veri çerçevesi olarak saklamak için sıklıkla compute() kullanılır.
a_tibble %>%
sdf_sample(<some args>) %>%
compute("sample_dataset")
Sonuçları yeniden üretilebilir kılmak için seed bağımsız değişkeniyle bir rastgele sayı tohumu da ayarlayabilirsin. Bunu yapmak, kodunu her çalıştırdığında aynı rastgele veri kümesini elde etmeni sağlar. Seed için hangi sayıyı kullandığın önemli değildir; sevdiğin herhangi bir pozitif tam sayıyı seçebilirsin.
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta saklanan parça (track) üst verisine bağlı bir tibble track_metadata_tbl olarak önceden tanımlandı.
- Parça üst verisinin %1'ini yerine koymadan örneklemek için
sdf_sample()kullan.- Rastgele tohum ayarlamak için
seedbağımsız değişkenine20000229geçir.
- Rastgele tohum ayarlamak için
- Sonucu hesapla ve
"sample_track_metadata"adlı bir tabloda sakla.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Sample the data without replacement
___ %>%
# Compute the result
___