BaşlayınÜcretsiz başlayın

Sütun seçme

Spark'ta saklanan veri çerçevelerini (data frame) değiştirmenin en kolay yolu dplyr söz dizimini kullanmaktır. dplyr söz dizimiyle veri çerçevelerini değiştirme, Data Manipulation with dplyr ve Joining Data with dplyr kurslarında ayrıntılı olarak ele alınıyor; ancak önümüzdeki bir buçuk bölümde tüm önemli noktaları birlikte gözden geçireceksin.

dplyr ile bir veri çerçevesi üzerinde yapabileceğin beş temel işlem vardır. Sütunları seçebilir, satırları filtreleyebilir, satırların sırasını düzenleyebilir, sütunları değiştirebilir veya yeni sütunlar ekleyebilir ve özet istatistikler hesaplayabilirsin.

Hadi sütun seçmeyle başlayalım. Bu işlem, bir tibble ve ardından tutmak istediğin sütunların tırnaksız adlarıyla select() çağrılarak yapılır. dplyr fonksiyonları geleneksel olarak magrittr'ın boru (pipe) operatörü %>% ile kullanılır. x, y ve z sütunlarını seçmek için aşağıdakini yazarsın.

a_tibble %>%
  select(x, y, z)

Köşeli parantezle indekslemenin şu anda sparklyr içinde desteklenmediğini unutma. Yani şunu yapamazsın:

a_tibble[, c("x", "y", "z")]

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

Senin için spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta saklanan parça (track) metadatasına bağlı bir tibble, track_metadata_tbl olarak önceden tanımlandı.

  • select() kullanarak artist_name, release, title ve year sütunlarını seç.
  • Aynı şeyi köşeli parantez indeksleme ile yapmayı dene. Sürpriz! Bu kod bir hata fırlatıyor, bu yüzden tryCatch() çağrısına sarıldı.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
Kodu Düzenle ve Çalıştır