Un extractor de conținut
În exercițiile anterioare, ai stabilit că toate elementele din vectorul de URL-uri primit returnează codul de stare 200. Acum că știi că sunt accesibile, vei aprofunda web scraping-ul, extragând conținut din pagini.
Pentru aceasta, vom folosi funcții din pachetul rvest, care vor fi preumplute cu partial(). Funcțiile pe care le vei scrie în acest exercițiu vor extrage toate nodurile HTML H2 dintr-o pagină — pe o pagină web, aceste noduri H2 corespund titlurilor de nivel 2. După ce am extras aceste titluri, funcția html_text() va fi folosită pentru a extrage conținutul text din HTML-ul brut.
purrr și rvest au fost deja încărcate, iar vectorul urls este disponibil în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Programare funcțională intermediară cu purrr
Instrucțiuni pentru exercițiu
Începe prin preumplerea funcției
html_nodes()cucss = "h2".Combină această funcție nou creată între
read_htmlșihtml_text, pentru a crea un extractor de text pentru titlurileH2.Aplică această funcție pe vectorul
urlsși denumește rezultatul.Afișează rezultatul pentru a vedea cum arată.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)
# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)
# Map get_content to the urls list
res <- ___(urls, ___) %>%
set_names(___)
# Print the results to the console
___