Sütunları dönüştürme (mutate)
Şaşırtıcı gelebilir ama her veri kümesi baştan tertemiz olmaz! Çoğu zaman değerleri düzeltmen ya da mevcut verilerinden türetilen yeni sütunlar oluşturman gerekir. Sütunları değiştirme veya ekleme süreci, dplyr terminolojisinde "mutation" olarak adlandırılır ve mutate() ile yapılır. Bu fonksiyon bir tibble ve sütunları güncellemek için adlandırılmış argümanlar alır. Her bir argümanın adı, değiştirilecek veya eklenecek sütunun adı; değeri ise nasıl güncelleneceğini açıklayan bir ifadedir. Örneğin, x ve y sütunlarına sahip bir tibble için aşağıdaki kod x'i günceller ve yeni bir z sütunu oluşturur.
a_tibble %>%
mutate(
x = x + y,
z = log(x)
)
Eğer hâlâ mesaj netleşmediyse: temel R fonksiyonları Spark tibble'larıyla çalışmaz; bu amaçla within() veya transform() kullanamazsın.
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
Senin için spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta depolanan parça (track) metadatasına bağlı bir tibble track_metadata_tbl olarak önceden tanımlandı.
titlevedurationalanlarını seç. Sürelerin saniye cinsinden olduğunu unutma.- Sonucu
mutate()ile pipe ederek, parça süresini dakika cinsinden içeren yeni birduration_minutesalanı oluştur.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___