URL'leri analiz etme
Hâlâ #RStudioConf veri kümesini keşfetmeye devam ediyoruz. Bu egzersizde, tweet'lerde yer alan URL'leri analiz etmeye odaklanacağız.
URL'ler "url_urls" adlı bir öğede bulunur. Bu "url_urls" öğeleri, tweet'te URL yoksa NULL, varsa bir veya daha fazla URL içeren bir liste barındırır.
Veri kümesinden tüm "url_urls" öğelerini çıkararak başlayacağız, ardından kaç tweet'in GitHub ile ilgili bir URL'ye bağlantı içerdiğini saymak için purrr ve stringr'ı birlikte kullanacağız. GitHub geliştiriciler için popüler bir web sitesi olduğundan, bu sitenin yüksek yaygınlığı veri kümemizde güçlü bir geliştirici topluluğuna işaret edecektir.
purrr ve stringr senin için yüklendi ve rstudioconf veri kümesi çalışma alanında hâlâ mevcut.
Bu egzersiz, kursun bir parçasıdır
purrr ile Orta Düzey Fonksiyonel Programlama
Egzersiz talimatları
Tüm
"urls_url"öğelerini çıkar ve sonucu bir hiyerarşi seviyesini kaldırmak içinflatten()içine geçir.Sonuçlardaki
NULLdeğerlerini kaldır.Bir karakter dizisinin
"github"içerip içermediğini algılayanhas_githubadlı bir eşleyici (mapper) oluştur.Mantıksal değer döndüren
map_*()varyantınıhas_githubile kullan ve"github"içeren bağlantıların sayısını bulmak için sonucusum()'a geçir.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
___()
# Remove the NULL
compact_urls <- ___(___)
# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))
# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
___()