BaşlayınÜcretsiz başlayın

Sütunları özetleme

Önceki egzersizde gördüğün mutate() fonksiyonu, girdi olarak sütunlar alır ve bir sütun döndürür. Ortalama, maksimum veya standart sapma gibi özet istatistikler hesaplıyorsan, genellikle girdi olarak sütunlar alıp tek bir değer döndürmek istersin. Bu da summarize() fonksiyonuyla yapılır.

a_tibble %>%
  summarize(
    mean_x       = mean(x),
    sd_x_times_y = sd(x * y)
  )

dplyr'ın (ve bunu sparklyra da aktaran) veriyi her zaman tibble biçiminde tutma felsefesine dikkat et. Bu yüzden burada dönen değer, tek satırlı ve hesaplanan her özet istatistik için bir sütunu olan bir tibble'dır.

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

Senin için spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta saklanan parça meta verilerine bağlı bir tibble, track_metadata_tbl olarak önceden tanımlandı.

  • title ve duration alanlarını seç.
  • Sonucu pipe ederek, parçanın süresini dakikaya çeviren yeni bir alan duration_minutes oluştur.
  • Sonucu pipe ederek summarize() ile dakikadaki ortalama süreyi hesapla ve bunu mean_duration_minutes adlı bir alana yaz.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___ %>%
  # Summarize columns
  ___
Kodu Düzenle ve Çalıştır