Ekstraktor treści
W poprzednich ćwiczeniach ustaliłeś, że wszystkie elementy podanego wektora URL-i zwracają kod statusu 200. Skoro wiesz już, że są one dostępne, czas zagłębić się w web scraping i przejść do ekstrakcji treści.
W tym celu użyjemy funkcji z pakietu rvest, które wstępnie wypełnimy argumentami za pomocą partial(). Funkcje napisane w tym ćwiczeniu będą wyodrębniać wszystkie węzły HTML H2 ze strony — na stronie internetowej węzły H2 odpowiadają nagłówkom drugiego poziomu. Po wyodrębnieniu tych tytułów funkcja html_text() posłuży do wyciągnięcia treści tekstowej z surowego kodu HTML.
Biblioteki purrr i rvest są już wczytane, a wektor urls jest dostępny w twoim środowisku pracy.
To ćwiczenie jest częścią kursu
Funkcyjne programowanie średnio zaawansowane z purrr
Instrukcje do ćwiczenia
Zacznij od wstępnego wypełnienia funkcji
html_nodes()argumentemcss = "h2".Połącz nowo utworzoną funkcję z
read_htmlihtml_text, tworząc ekstraktor tekstu dla nagłówkówH2.Uruchom tę funkcję na wektorze
urlsi nadaj wynikowi nazwę.Wyświetl wynik, żeby zobaczyć, jak wygląda.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)
# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)
# Map get_content to the urls list
res <- ___(urls, ___) %>%
set_names(___)
# Print the results to the console
___