Kom igångKom igång gratis

En innehållsextraherare

I de föregående övningarna fastställde du att alla element i URL-vektorn returnerar statuskoden 200. Nu när du vet att de är tillgängliga går vi djupare in i webbskrapningen och utför lite innehållsextrahering.

För att göra detta använder vi funktioner från paketet rvest, som prefylls med partial(). Funktionerna vi skriver i den här övningen extraherar alla HTML-noder av typen H2 från en sida – på en webbsida motsvarar dessa H2-noder rubrikerna på nivå 2. När vi har extraherat dessa titlar används funktionen html_text() för att hämta textinnehållet från rå HTML.

purrr och rvest har redan laddats in, och vektorn urls finns tillgänglig i din arbetsyta.

Den här övningen är en del av kursen

Funktionell programmering på mellannivå med purrr

Visa kurs

Övningsinstruktioner

  • Börja med att prefylla html_nodes() med css = "h2".

  • Kombinera den nyligen skapade funktionen med read_html och html_text för att skapa en textextraherare för H2-rubriker.

  • Kör funktionen på vektorn urls och namnge resultatet.

  • Skriv ut resultatet för att se hur det ser ut.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
Redigera och kör kod