ÎncepețiÎncepe gratuit

Un extractor de conținut

În exercițiile anterioare, ai stabilit că toate elementele din vectorul de URL-uri primit returnează codul de stare 200. Acum că știi că sunt accesibile, vei aprofunda web scraping-ul, extragând conținut din pagini.

Pentru aceasta, vom folosi funcții din pachetul rvest, care vor fi preumplute cu partial(). Funcțiile pe care le vei scrie în acest exercițiu vor extrage toate nodurile HTML H2 dintr-o pagină — pe o pagină web, aceste noduri H2 corespund titlurilor de nivel 2. După ce am extras aceste titluri, funcția html_text() va fi folosită pentru a extrage conținutul text din HTML-ul brut.

purrr și rvest au fost deja încărcate, iar vectorul urls este disponibil în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Programare funcțională intermediară cu purrr

Vezi cursul

Instrucțiuni pentru exercițiu

  • Începe prin preumplerea funcției html_nodes() cu css = "h2".

  • Combină această funcție nou creată între read_html și html_text, pentru a crea un extractor de text pentru titlurile H2.

  • Aplică această funcție pe vectorul urls și denumește rezultatul.

  • Afișează rezultatul pentru a vedea cum arată.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
Editează și rulează codul