开始使用免费开始使用

对多页面爬虫应用限速

本练习的目标是获取地球上最高的三座山峰的坐标及其名称

您将实时从对应的 Wikipedia 页面获取这些信息。为避免对 Wikipedia 造成过大压力,您将使用 slowly() 函数进行限速。在每次请求一个 Wikipedia 页面后,程序都应等待一小段时间。虽然只有 3 个页面不算多,但这一原则适用于任何规模的抓取:请保持克制,在请求之间添加等待时间。

山峰的名称位于 ID"firstHeading" 的元素中;坐标位于 class"geo-dms" 的元素中,该元素是 ID"coordinates" 的元素的一个后代

已预加载 purrr,各页面的 URL 已存于 mountain_wiki_pages 中。

本练习是课程的一部分

R 语言网页抓取

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Define a throttled read_html() function with a delay of 0.5s
read_html_delayed <- ___(___, 
                         rate = ___(___))
编辑并运行代码