BaşlayınÜcretsiz başlayın

Örnekleme ile veriyi küçültme

Büyük bir veri kümesiyle çalışırken, genellikle her zaman tamamıyla çalışmana gerek yoktur. Özellikle projenin başında, ne yapmak istediğini denerken ve keşfederken, verinin daha küçük bir alt kümesiyle çalışarak daha hızlı yineleme yapabilirsin. sdf_sample() bunu yapmanın kullanışlı bir yolunu sunar. Bir tibble ve döndürülecek satırların oranını alır. Bu durumda, yerine koymadan örnekleme yapmak istiyorsun. Veri kümenin onda birinin rastgele bir örneğini almak için aşağıdaki kodu kullanırsın.

a_tibble %>%
  sdf_sample(fraction = 0.1, replacement = FALSE)

Örneklemenin sonuçları rastgele olduğundan ve küçültülmüş veri kümesini yeniden kullanmak isteyebileceğinden, sonuçları başka bir Spark veri çerçevesi olarak saklamak için sıklıkla compute() kullanılır.

a_tibble %>%
  sdf_sample(<some args>) %>%
  compute("sample_dataset")

Sonuçları yeniden üretilebilir kılmak için seed bağımsız değişkeniyle bir rastgele sayı tohumu da ayarlayabilirsin. Bunu yapmak, kodunu her çalıştırdığında aynı rastgele veri kümesini elde etmeni sağlar. Seed için hangi sayıyı kullandığın önemli değildir; sevdiğin herhangi bir pozitif tam sayıyı seçebilirsin.

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta saklanan parça (track) üst verisine bağlı bir tibble track_metadata_tbl olarak önceden tanımlandı.

  • Parça üst verisinin %1'ini yerine koymadan örneklemek için sdf_sample() kullan.
    • Rastgele tohum ayarlamak için seed bağımsız değişkenine 20000229 geçir.
  • Sonucu hesapla ve "sample_track_metadata" adlı bir tabloda sakla.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Sample the data without replacement
  ___ %>%
  # Compute the result
  ___
Kodu Düzenle ve Çalıştır