Metoda httr
Iată un cod rvest pe care l-am folosit pentru a afla altitudinea unui loc superb unde mi-am petrecut recent vacanța.
# Get the HTML document from Wikipedia
wikipedia_page <- read_html('https://en.wikipedia.org/wiki/Varigotti')
# Parse the document and extract the elevation from it
wikipedia_page %>%
html_elements('table tr:nth-child(9) > td') %>%
html_text()
Așa cum ai învățat în video, read_html() emite de fapt o cerere HTTP GET atunci când primește un URL, ca în cazul de față.
Scopul acestui exercițiu este să replici aceeași interogare fără read_html(), folosind în schimb metodele din httr.
Notă: De obicei rvest este suficient, dar dacă vrei să personalizezi cererile – așa cum vei vedea mai târziu în acest capitol – trebuie să cunoști modul de lucru cu httr.
Pentru puțină recapitulare, vei converti și selectorul CSS folosit în html_elements() într-o interogare XPATH.
Acest exercițiu face parte din cursul
Web Scraping în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Get the HTML document from Wikipedia using httr
wikipedia_response <- ___('https://en.wikipedia.org/wiki/Varigotti')
# Parse the response into an HTML doc
wikipedia_page <- ___(___)