提取提及
在推文数据集的每个子列表中,都有一个名为 "mentions_screen_name" 的元素(即 Twitter 的用户名)。如果推文中没有提及,该元素为 NULL;否则包含一个或多个被提及的用户名。要从一组推文中识别受欢迎的账号,可以统计在这一推文集合中被提及次数最多的用户。
我们将先提取一个包含所有提及的向量。拿到这个新向量后,再统计每个账号被提及的次数。为此,您将通过组合 table()(统计向量中各元素出现的次数)、sort() 和 tail() 来构建一个新的复合函数。
purrr 已为您加载,数据集中提供了 rstudioconf。
本练习是课程的一部分
使用 purrr 的函数式编程进阶
练习说明
构建一个由
as_vector()、compact()和flatten()组合而成的函数。创建一个接收两个参数的函数:
list和what。该函数将运行map( list, what ),并把结果传递给flatten_to_vector。创建
six_most,一个将tail()、sort()和table()组合起来的函数。在
rstudioconf上运行extractor(),并将结果传递给six_most()。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Combine as_vector(), compact(), and flatten()
flatten_to_vector <- ___(___, ___, ___)
# Complete the function
extractor <- function(list, what = "mentions_screen_name"){
map( ___ , ___ ) %>%
___()
}
# Create six_most, with tail(), sort(), and table()
six_most <- ___(___, ___, ___)
# Run extractor() on rstudioconf
___(rstudioconf) %>%
___()