Sıradan insanlar
distinct() fonksiyonu sana benzersiz değerleri gösterdi. Ayrıca her değerden kaç tane olduğunun bilinmesi de faydalıdır. Bunun base R karşılığı table() fonksiyonudur; bu, tidyverse felsefesine (her şeyi tibble olarak tutma) uymadığı için sparklyr içinde desteklenmez. Bunun yerine count() kullanmalısın. Kullanmak için sütun adlarını tırnaksız olarak geçirirsin. Örneğin, x, y ve z sütunlarının farklı kombinasyonlarının sayımlarını bulmak için şunu yazarsın:
a_tibble %>%
count(x, y, z)
Sonuç şununla aynıdır:
a_tibble %>%
distinct(x, y, z)
… fakat ekstra olarak, sayımları içeren n adlı bir sütun elde edersin.
count() fonksiyonunun çok güzel bir kullanım alanı da bir şeyin en yaygın değerlerini bulmaktır. Bunu yapmak için count() çağırıp n sütunundaki değerlere göre satırları azalan şekilde sıralayan sort = TRUE argümanını verirsin, ardından sonuçları en üstteki belli sayıda değere sınırlamak için slice_max() kullanırsın. (slice_max(), base R'deki head() fonksiyonuna benzer, ancak Spark gibi uzaktaki veri kümeleriyle çalışır.) Örneğin, x, y ve z sütunlarının en yaygın 20 kombinasyonunu almak için şunu kullanırsın:
a_tibble %>%
count(x, y, z, sort = TRUE) %>%
slice_max(20)
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
spark_conn olarak bir Spark bağlantısı senin için oluşturuldu. Spark'ta depolanan parça üst verilerine bağlı bir tibble track_metadata_tbl olarak önceden tanımlandı.
track_metadata_tbliçindekiartist_namesütunundaki değerleri say.- Satırları popülerliğe göre azalan sıralamak için
sort = TRUEgeçir.
- Satırları popülerliğe göre azalan sıralamak için
- Sonuçları en üst 20 ile sınırlamak için
slice_max()kullan.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Count the artist_name values
___ %>%
# Restrict to top 20
___