Sütun seçme
Spark'ta saklanan veri çerçevelerini (data frame) değiştirmenin en kolay yolu dplyr söz dizimini kullanmaktır. dplyr söz dizimiyle veri çerçevelerini değiştirme, Data Manipulation with dplyr ve Joining Data with dplyr kurslarında ayrıntılı olarak ele alınıyor; ancak önümüzdeki bir buçuk bölümde tüm önemli noktaları birlikte gözden geçireceksin.
dplyr ile bir veri çerçevesi üzerinde yapabileceğin beş temel işlem vardır. Sütunları seçebilir, satırları filtreleyebilir, satırların sırasını düzenleyebilir, sütunları değiştirebilir veya yeni sütunlar ekleyebilir ve özet istatistikler hesaplayabilirsin.
Hadi sütun seçmeyle başlayalım. Bu işlem, bir tibble ve ardından tutmak istediğin sütunların tırnaksız adlarıyla select() çağrılarak yapılır. dplyr fonksiyonları geleneksel olarak magrittr'ın boru (pipe) operatörü %>% ile kullanılır. x, y ve z sütunlarını seçmek için aşağıdakini yazarsın.
a_tibble %>%
select(x, y, z)
Köşeli parantezle indekslemenin şu anda sparklyr içinde desteklenmediğini unutma. Yani şunu yapamazsın:
a_tibble[, c("x", "y", "z")]
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
Senin için spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta saklanan parça (track) metadatasına bağlı bir tibble, track_metadata_tbl olarak önceden tanımlandı.
select()kullanarakartist_name,release,titleveyearsütunlarını seç.- Aynı şeyi köşeli parantez indeksleme ile yapmayı dene. Sürpriz! Bu kod bir hata fırlatıyor, bu yüzden
tryCatch()çağrısına sarıldı.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)