ÎncepețiÎncepe gratuit

Metoda httr

Iată un cod rvest pe care l-am folosit pentru a afla altitudinea unui loc superb unde mi-am petrecut recent vacanța.

# Get the HTML document from Wikipedia
wikipedia_page <- read_html('https://en.wikipedia.org/wiki/Varigotti')
# Parse the document and extract the elevation from it
wikipedia_page %>% 
  html_elements('table tr:nth-child(9) > td') %>% 
  html_text()

Așa cum ai învățat în video, read_html() emite de fapt o cerere HTTP GET atunci când primește un URL, ca în cazul de față.

Scopul acestui exercițiu este să replici aceeași interogare fără read_html(), folosind în schimb metodele din httr.

Notă: De obicei rvest este suficient, dar dacă vrei să personalizezi cererile – așa cum vei vedea mai târziu în acest capitol – trebuie să cunoști modul de lucru cu httr.

Pentru puțină recapitulare, vei converti și selectorul CSS folosit în html_elements() într-o interogare XPATH.

Acest exercițiu face parte din cursul

Web Scraping în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Get the HTML document from Wikipedia using httr
wikipedia_response <- ___('https://en.wikipedia.org/wiki/Varigotti')
# Parse the response into an HTML doc
wikipedia_page <- ___(___)
Editează și rulează codul