对多页面爬虫应用限速
本练习的目标是获取地球上最高的三座山峰的坐标及其名称。
您将实时从对应的 Wikipedia 页面获取这些信息。为避免对 Wikipedia 造成过大压力,您将使用 slowly() 函数进行限速。在每次请求一个 Wikipedia 页面后,程序都应等待一小段时间。虽然只有 3 个页面不算多,但这一原则适用于任何规模的抓取:请保持克制,在请求之间添加等待时间。
山峰的名称位于 ID 为 "firstHeading" 的元素中;坐标位于 class 为 "geo-dms" 的元素中,该元素是 ID 为 "coordinates" 的元素的一个后代。
已预加载 purrr,各页面的 URL 已存于 mountain_wiki_pages 中。
本练习是课程的一部分
R 语言网页抓取
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Define a throttled read_html() function with a delay of 0.5s
read_html_delayed <- ___(___,
rate = ___(___))