Benzersiz satırları seçme
Eğer kategorik bir değişkeni bir factor içinde saklıyorsan, tek tek kategorilerin ne olduğunu bilmek genellikle faydalıdır; bunu levels() fonksiyonuyla yaparsın. Bir tibble için daha genel kavram, benzersiz verilere sahip satırları bulmaktır. SQL terminolojisini izleyerek, bu işlem distinct() fonksiyonuyla yapılır. Bunu doğrudan veri kümen üzerinde kullanarak belirli sütun kümelerindeki benzersiz birleşimleri bulabilirsin. Örneğin, x, y ve z sütunlarındaki değerlerin benzersiz birleşimlerini bulmak için aşağıdakini yazardın.
a_tibble %>%
distinct(x, y, z)
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta depolanan parça (track) metadatasına bağlı bir tibble, track_metadata_tbl olarak önceden tanımlandı.
track_metadata_tbliçindekiartist_namesütununun benzersiz değerlerini bul.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___