BaşlayınÜcretsiz başlayın

URL'leri analiz etme

Hâlâ #RStudioConf veri kümesini keşfetmeye devam ediyoruz. Bu egzersizde, tweet'lerde yer alan URL'leri analiz etmeye odaklanacağız.

URL'ler "url_urls" adlı bir öğede bulunur. Bu "url_urls" öğeleri, tweet'te URL yoksa NULL, varsa bir veya daha fazla URL içeren bir liste barındırır.

Veri kümesinden tüm "url_urls" öğelerini çıkararak başlayacağız, ardından kaç tweet'in GitHub ile ilgili bir URL'ye bağlantı içerdiğini saymak için purrr ve stringr'ı birlikte kullanacağız. GitHub geliştiriciler için popüler bir web sitesi olduğundan, bu sitenin yüksek yaygınlığı veri kümemizde güçlü bir geliştirici topluluğuna işaret edecektir.

purrr ve stringr senin için yüklendi ve rstudioconf veri kümesi çalışma alanında hâlâ mevcut.

Bu egzersiz, kursun bir parçasıdır

purrr ile Orta Düzey Fonksiyonel Programlama

Kursa Göz Atın

Egzersiz talimatları

  • Tüm "urls_url" öğelerini çıkar ve sonucu bir hiyerarşi seviyesini kaldırmak için flatten() içine geçir.

  • Sonuçlardaki NULL değerlerini kaldır.

  • Bir karakter dizisinin "github" içerip içermediğini algılayan has_github adlı bir eşleyici (mapper) oluştur.

  • Mantıksal değer döndüren map_*() varyantını has_github ile kullan ve "github" içeren bağlantıların sayısını bulmak için sonucu sum()'a geçir.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
Kodu Düzenle ve Çalıştır