En innehållsextraherare
I de föregående övningarna fastställde du att alla element i URL-vektorn returnerar statuskoden 200. Nu när du vet att de är tillgängliga går vi djupare in i webbskrapningen och utför lite innehållsextrahering.
För att göra detta använder vi funktioner från paketet rvest, som prefylls med partial(). Funktionerna vi skriver i den här övningen extraherar alla HTML-noder av typen H2 från en sida – på en webbsida motsvarar dessa H2-noder rubrikerna på nivå 2. När vi har extraherat dessa titlar används funktionen html_text() för att hämta textinnehållet från rå HTML.
purrr och rvest har redan laddats in, och vektorn urls finns tillgänglig i din arbetsyta.
Den här övningen är en del av kursen
Funktionell programmering på mellannivå med purrr
Övningsinstruktioner
Börja med att prefylla
html_nodes()medcss = "h2".Kombinera den nyligen skapade funktionen med
read_htmlochhtml_textför att skapa en textextraherare förH2-rubriker.Kör funktionen på vektorn
urlsoch namnge resultatet.Skriv ut resultatet för att se hur det ser ut.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)
# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)
# Map get_content to the urls list
res <- ___(urls, ___) %>%
set_names(___)
# Print the results to the console
___