Sütunları özetleme
Önceki egzersizde gördüğün mutate() fonksiyonu, girdi olarak sütunlar alır ve bir sütun döndürür. Ortalama, maksimum veya standart sapma gibi özet istatistikler hesaplıyorsan, genellikle girdi olarak sütunlar alıp tek bir değer döndürmek istersin. Bu da summarize() fonksiyonuyla yapılır.
a_tibble %>%
summarize(
mean_x = mean(x),
sd_x_times_y = sd(x * y)
)
dplyr'ın (ve bunu sparklyra da aktaran) veriyi her zaman tibble biçiminde tutma felsefesine dikkat et. Bu yüzden burada dönen değer, tek satırlı ve hesaplanan her özet istatistik için bir sütunu olan bir tibble'dır.
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
Senin için spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta saklanan parça meta verilerine bağlı bir tibble, track_metadata_tbl olarak önceden tanımlandı.
titlevedurationalanlarını seç.- Sonucu pipe ederek, parçanın süresini dakikaya çeviren yeni bir alan
duration_minutesoluştur. - Sonucu pipe ederek
summarize()ile dakikadaki ortalama süreyi hesapla ve bunumean_duration_minutesadlı bir alana yaz.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___ %>%
# Summarize columns
___