Použití throttlingu v crawleru pro více stránek
Cílem tohoto cvičení je získat souřadnice tří nejvyšších horských vrcholů na Zemi spolu s jejich názvy.
Tyto informace načteš v reálném čase z příslušných stránek Wikipedie. Aby ses Wikipedii zbytečně nevyhýbal/a přílišnou zátěží, použiješ throttling pomocí funkce slowly(). Po každém požadavku na stránku Wikipedie program chvíli počká. Tři stránky Wikipedie samy o sobě příliš nezatěžují, ale princip platí pro jakékoli množství scrapingu: buď ohleduplný/á a mezi požadavky vkládej prodlevu.
Název vrcholu najdeš v elementu s ID "firstHeading", souřadnice jsou v elementu s třídou "geo-dms", který je potomkem elementu s ID "coordinates".
purrr je předem načtený a URL adresy jsou uloženy v proměnné mountain_wiki_pages.
Toto cvičení je součástí kurzu
Web Scraping v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define a throttled read_html() function with a delay of 0.5s
read_html_delayed <- ___(___,
rate = ___(___))