Bir içerik çıkarıcı
Önceki egzersizlerde, verilen URLs vektöründeki tüm öğelerin 200 durum kodu döndürdüğünü doğruladın. Artık erişilebilir olduklarını bildiğine göre, web kazımayı biraz daha derinleştirip içerik çıkarma yapacaksın.
Bunu yapmak için rvest paketinden fonksiyonlar kullanacağız ve bu fonksiyonları partial() ile önceden argüman doldurarak ayarlayacağız. Bu egzersizde yazacağımız fonksiyonlar bir sayfadaki tüm H2 HTML düğümlerini çıkaracak — bir web sayfasında bu H2 düğümleri seviye 2 başlıklara karşılık gelir. Bu başlıkları çıkardıktan sonra, ham HTML'den metin içeriğini almak için html_text() fonksiyonunu kullanacağız.
purrr ve rvest senin için yüklendi ve urls vektörü çalışma alanında hazır.
Bu egzersiz, kursun bir parçasıdır
purrr ile Orta Düzey Fonksiyonel Programlama
Egzersiz talimatları
html_nodes()fonksiyonunucss = "h2"ile önceden doldurarak başla.Bu yeni oluşturduğun fonksiyonu
read_htmlilehtml_textarasına yerleştirerekH2başlıkları için bir metin çıkarıcı oluştur.Bu fonksiyonu
urlsvektörü üzerinde çalıştır ve sonucu adlandır.Sonucun nasıl göründüğünü görmek için yazdır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)
# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)
# Map get_content to the urls list
res <- ___(urls, ___) %>%
set_names(___)
# Print the results to the console
___