开始使用免费开始使用

分析 URL

我们仍在探索 #RStudioConf 数据集。本练习将重点分析推文中包含的 URL。

这些 URL 位于名为 "url_urls" 的元素中。若推文中没有 URL,则这些 "url_urls" 元素为 NULL;否则为由一个或多个 URL 组成的列表。

我们将先从数据集中提取所有 "url_urls" 元素,然后结合使用 purrrstringr 来统计包含 GitHub 相关 URL 的推文数量。由于 GitHub 是开发者常用的网站,该网站出现比例越高,越能说明我们的数据集中开发者社区越活跃。

已为您加载 purrrstringrrstudioconf 数据集也仍在您的工作区中可用。

本练习是课程的一部分

使用 purrr 的函数式编程进阶

查看课程

练习说明

  • 提取所有 "urls_url" 元素,并将结果传入 flatten() 以去除一层嵌套层级。

  • 从结果中移除 NULL

  • 创建名为 has_github 的 mapper,用于检测某个字符串是否包含 "github"

  • has_github 使用适用于逻辑值的 map_*() 变体,并将结果传给 sum(),以统计包含 "github" 的链接数量。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
编辑并运行代码