开始使用免费开始使用

提取提及

在推文数据集的每个子列表中,都有一个名为 "mentions_screen_name" 的元素(即 Twitter 的用户名)。如果推文中没有提及,该元素为 NULL;否则包含一个或多个被提及的用户名。要从一组推文中识别受欢迎的账号,可以统计在这一推文集合中被提及次数最多的用户。

我们将先提取一个包含所有提及的向量。拿到这个新向量后,再统计每个账号被提及的次数。为此,您将通过组合 table()(统计向量中各元素出现的次数)、sort()tail() 来构建一个新的复合函数。

purrr 已为您加载,数据集中提供了 rstudioconf

本练习是课程的一部分

使用 purrr 的函数式编程进阶

查看课程

练习说明

  • 构建一个由 as_vector()compact()flatten() 组合而成的函数。

  • 创建一个接收两个参数的函数:listwhat。该函数将运行 map( list, what ),并把结果传递给 flatten_to_vector

  • 创建 six_most,一个将 tail()sort()table() 组合起来的函数。

  • rstudioconf 上运行 extractor(),并将结果传递给 six_most()

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Combine as_vector(), compact(), and flatten()
flatten_to_vector <- ___(___, ___, ___)

# Complete the function
extractor <- function(list, what = "mentions_screen_name"){
  map( ___ , ___ ) %>%
    ___()
}

# Create six_most, with tail(), sort(), and table()
six_most <- ___(___, ___, ___)

# Run extractor() on rstudioconf
___(rstudioconf) %>% 
  ___()
编辑并运行代码