BaşlayınÜcretsiz başlayın

Bir içerik çıkarıcı

Önceki egzersizlerde, verilen URLs vektöründeki tüm öğelerin 200 durum kodu döndürdüğünü doğruladın. Artık erişilebilir olduklarını bildiğine göre, web kazımayı biraz daha derinleştirip içerik çıkarma yapacaksın.

Bunu yapmak için rvest paketinden fonksiyonlar kullanacağız ve bu fonksiyonları partial() ile önceden argüman doldurarak ayarlayacağız. Bu egzersizde yazacağımız fonksiyonlar bir sayfadaki tüm H2 HTML düğümlerini çıkaracak — bir web sayfasında bu H2 düğümleri seviye 2 başlıklara karşılık gelir. Bu başlıkları çıkardıktan sonra, ham HTML'den metin içeriğini almak için html_text() fonksiyonunu kullanacağız.

purrr ve rvest senin için yüklendi ve urls vektörü çalışma alanında hazır.

Bu egzersiz, kursun bir parçasıdır

purrr ile Orta Düzey Fonksiyonel Programlama

Kursa Göz Atın

Egzersiz talimatları

  • html_nodes() fonksiyonunu css = "h2" ile önceden doldurarak başla.

  • Bu yeni oluşturduğun fonksiyonu read_html ile html_text arasına yerleştirerek H2 başlıkları için bir metin çıkarıcı oluştur.

  • Bu fonksiyonu urls vektörü üzerinde çalıştır ve sonucu adlandır.

  • Sonucun nasıl göründüğünü görmek için yazdır.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
Kodu Düzenle ve Çalıştır