BaşlayınÜcretsiz başlayın

Sıradan insanlar

distinct() fonksiyonu sana benzersiz değerleri gösterdi. Ayrıca her değerden kaç tane olduğunun bilinmesi de faydalıdır. Bunun base R karşılığı table() fonksiyonudur; bu, tidyverse felsefesine (her şeyi tibble olarak tutma) uymadığı için sparklyr içinde desteklenmez. Bunun yerine count() kullanmalısın. Kullanmak için sütun adlarını tırnaksız olarak geçirirsin. Örneğin, x, y ve z sütunlarının farklı kombinasyonlarının sayımlarını bulmak için şunu yazarsın:

a_tibble %>%
  count(x, y, z)

Sonuç şununla aynıdır:

a_tibble %>%
  distinct(x, y, z)

… fakat ekstra olarak, sayımları içeren n adlı bir sütun elde edersin.

count() fonksiyonunun çok güzel bir kullanım alanı da bir şeyin en yaygın değerlerini bulmaktır. Bunu yapmak için count() çağırıp n sütunundaki değerlere göre satırları azalan şekilde sıralayan sort = TRUE argümanını verirsin, ardından sonuçları en üstteki belli sayıda değere sınırlamak için slice_max() kullanırsın. (slice_max(), base R'deki head() fonksiyonuna benzer, ancak Spark gibi uzaktaki veri kümeleriyle çalışır.) Örneğin, x, y ve z sütunlarının en yaygın 20 kombinasyonunu almak için şunu kullanırsın:

a_tibble %>%
  count(x, y, z, sort = TRUE) %>%
  slice_max(20)

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

spark_conn olarak bir Spark bağlantısı senin için oluşturuldu. Spark'ta depolanan parça üst verilerine bağlı bir tibble track_metadata_tbl olarak önceden tanımlandı.

  • track_metadata_tbl içindeki artist_name sütunundaki değerleri say.
    • Satırları popülerliğe göre azalan sıralamak için sort = TRUE geçir.
  • Sonuçları en üst 20 ile sınırlamak için slice_max() kullan.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Count the artist_name values
  ___ %>%
  # Restrict to top 20
  ___
Kodu Düzenle ve Çalıştır