Kom igångKom igång gratis

Tillämpa hastighetsbegränsning på en flersidescrawler

Målet med den här övningen är att hämta koordinaterna för jordens tre högsta bergstoppar, tillsammans med deras namn.

Du hämtar informationen från respektive Wikipedia-sidor i realtid. För att inte belasta Wikipedia för hårt tillämpar du hastighetsbegränsning med funktionen slowly(). Efter varje anrop till en Wikipedia-sida ska programmet vänta en kort stund. Tre Wikipedia-sidor är kanske inte så mycket, men principen gäller oavsett hur mycket du skrapar: var försiktig och lägg in väntetid mellan förfrågningarna.

Du hittar bergstoppens namn i ett element med ID "firstHeading", medan koordinaterna finns i ett element med klassen "geo-dms", som är en ättling till ett element med ID "coordinates".

purrr är förinstallerat och URL:erna finns i mountain_wiki_pages.

Den här övningen är en del av kursen

Webbskrapning i R

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Define a throttled read_html() function with a delay of 0.5s
read_html_delayed <- ___(___, 
                         rate = ___(___))
Redigera och kör kod