Satırları filtreleme
Sütun seçmenin yanı sıra, veri künenin önemli kısımlarını çıkarmanın bir diğer yolu da satırları filtrelemektir. Bu, filter() fonksiyonu ile yapılır. filter() kullanmak için bir tibble ve bazı mantıksal koşullar verirsin. Örneğin, x sütunundaki değerlerin sıfırdan büyük olduğu ve y değerlerinin z değerlerine eşit olduğu satırları döndürmek için aşağıdakini kullanırsın.
a_tibble %>%
filter(x > 0, y == z)
Egzersize başlamadan önce iki uyarıya dikkat et. Birincisi, dplyr'ın filter() fonksiyonunu stats paketindeki filter() fonksiyonu ile karıştırma. İkincisi, sparklyr, dplyr kodunu Spark'a göndermeden önce SQL veritabanı koduna çevirir. Bu da şu an için yalnızca sınırlı sayıda filtreleme işleminin desteklendiği anlamına gelir. Örneğin, aşağıdaki gibi düzenli ifadelerle karakter satırlarını filtreleyemezsin:
a_tibble %>%
filter(grepl("a regex", x))
translate_sql() yardım sayfası kullanılabilir işlevleri açıklar. >, != ve %in% gibi karşılaştırma işleçlerini; +, ^ ve %% gibi aritmetik işleçleri; ve &, | ile ! gibi mantıksal işleçleri kullanabilirsin. Ayrıca log(), abs(), round() ve sin() gibi birçok matematiksel fonksiyon da desteklenir.
Daha önce olduğu gibi, köşeli parantez indeksleme şu anda çalışmıyor.
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
spark_conn olarak bir Spark bağlantısı senin için oluşturuldu. Spark'ta depolanan parça meta verilerine bağlı bir tibble track_metadata_tbl olarak önceden tanımlandı.
- Önceki egzersizde olduğu gibi,
select()ileartist_name,release,titleveyearsütunlarını seç. - Sonucu 1960'lardaki parçaları almak için
filter()ile pipe et.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_metadata_tbl has been pre-defined
glimpse(track_metadata_tbl)
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Filter rows
___