Tillämpa hastighetsbegränsning på en flersidescrawler
Målet med den här övningen är att hämta koordinaterna för jordens tre högsta bergstoppar, tillsammans med deras namn.
Du hämtar informationen från respektive Wikipedia-sidor i realtid. För att inte belasta Wikipedia för hårt tillämpar du hastighetsbegränsning med funktionen slowly(). Efter varje anrop till en Wikipedia-sida ska programmet vänta en kort stund. Tre Wikipedia-sidor är kanske inte så mycket, men principen gäller oavsett hur mycket du skrapar: var försiktig och lägg in väntetid mellan förfrågningarna.
Du hittar bergstoppens namn i ett element med ID "firstHeading", medan koordinaterna finns i ett element med klassen "geo-dms", som är en ättling till ett element med ID "coordinates".
purrr är förinstallerat och URL:erna finns i mountain_wiki_pages.
Den här övningen är en del av kursen
Webbskrapning i R
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Define a throttled read_html() function with a delay of 0.5s
read_html_delayed <- ___(___,
rate = ___(___))