ÎncepețiÎncepe gratuit

Aplică limitarea de viteză unui crawler multi-pagină

Scopul acestui exercițiu este să obții coordonatele celor mai înalte trei vârfuri muntoase de pe Pământ, împreună cu numele lor.

Vei extrage aceste informații din paginile lor corespunzătoare de pe Wikipedia, în timp real. Pentru a nu suprasolicita Wikipedia, vei aplica limitarea de viteză folosind funcția slowly(). După fiecare apel către o pagină Wikipedia, programul tău ar trebui să aștepte un timp scurt. Trei pagini Wikipedia poate că nu par mult, dar principiul se aplică pentru orice volum de scraping: fii „blând" și adaugă timp de așteptare între cereri.

Vei găsi numele vârfului într-un element cu ID-ul "firstHeading", iar coordonatele se află într-un element cu clasa "geo-dms", care este un descendent al unui element cu ID-ul "coordinates".

purrr a fost preîncărcat, iar URL-urile sunt conținute în mountain_wiki_pages.

Acest exercițiu face parte din cursul

Web Scraping în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Define a throttled read_html() function with a delay of 0.5s
read_html_delayed <- ___(___, 
                         rate = ___(___))
Editează și rulează codul