Kom igångKom igång gratis

Gör det på httr-sättet

Här är lite rvest-kod som jag använde för att ta reda på höjden över havet för en vacker plats där jag nyligen tillbringade min semester.

# Get the HTML document from Wikipedia
wikipedia_page <- read_html('https://en.wikipedia.org/wiki/Varigotti')
# Parse the document and extract the elevation from it
wikipedia_page %>% 
  html_elements('table tr:nth-child(9) > td') %>% 
  html_text()

Som du lärde dig i videon skickar read_html() faktiskt en HTTP GET-förfrågan när den får en URL, precis som i det här fallet.

Målet med den här övningen är att replikera samma förfrågan utan read_html(), men med httr-metoder i stället.

Obs: Vanligtvis räcker rvest utmärkt, men om du vill anpassa förfrågningar – som du får se senare i det här kapitlet – behöver du känna till hur httr fungerar.

Som en liten repetition ska du också översätta CSS-selektorn som används i html_elements() till en XPATH-fråga.

Den här övningen är en del av kursen

Webbskrapning i R

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Get the HTML document from Wikipedia using httr
wikipedia_response <- ___('https://en.wikipedia.org/wiki/Varigotti')
# Parse the response into an HTML doc
wikipedia_page <- ___(___)
Redigera och kör kod