Začněte nyníZačněte zdarma

Použití throttlingu v crawleru pro více stránek

Cílem tohoto cvičení je získat souřadnice tří nejvyšších horských vrcholů na Zemi spolu s jejich názvy.

Tyto informace načteš v reálném čase z příslušných stránek Wikipedie. Aby ses Wikipedii zbytečně nevyhýbal/a přílišnou zátěží, použiješ throttling pomocí funkce slowly(). Po každém požadavku na stránku Wikipedie program chvíli počká. Tři stránky Wikipedie samy o sobě příliš nezatěžují, ale princip platí pro jakékoli množství scrapingu: buď ohleduplný/á a mezi požadavky vkládej prodlevu.

Název vrcholu najdeš v elementu s ID "firstHeading", souřadnice jsou v elementu s třídou "geo-dms", který je potomkem elementu s ID "coordinates".

purrr je předem načtený a URL adresy jsou uloženy v proměnné mountain_wiki_pages.

Toto cvičení je součástí kurzu

Web Scraping v R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Define a throttled read_html() function with a delay of 0.5s
read_html_delayed <- ___(___, 
                         rate = ___(___))
Upravit a spustit kód