分析 URL
我们仍在探索 #RStudioConf 数据集。本练习将重点分析推文中包含的 URL。
这些 URL 位于名为 "url_urls" 的元素中。若推文中没有 URL,则这些 "url_urls" 元素为 NULL;否则为由一个或多个 URL 组成的列表。
我们将先从数据集中提取所有 "url_urls" 元素,然后结合使用 purrr 和 stringr 来统计包含 GitHub 相关 URL 的推文数量。由于 GitHub 是开发者常用的网站,该网站出现比例越高,越能说明我们的数据集中开发者社区越活跃。
已为您加载 purrr 和 stringr,rstudioconf 数据集也仍在您的工作区中可用。
本练习是课程的一部分
使用 purrr 的函数式编程进阶
练习说明
提取所有
"urls_url"元素,并将结果传入flatten()以去除一层嵌套层级。从结果中移除
NULL。创建名为
has_github的 mapper,用于检测某个字符串是否包含"github"。对
has_github使用适用于逻辑值的map_*()变体,并将结果传给sum(),以统计包含"github"的链接数量。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
___()
# Remove the NULL
compact_urls <- ___(___)
# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))
# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
___()