玩转推文,第 1 轮
还记得在本课程前面的章节中,您一直在一家网络机构担任数据分析师吗?您表现很出色,现在又接到一个新项目了 ;) 在本章中,您将分析一种新类型的数据:JSON 输出。
工程团队提供了一个数据采集的输出文件,里面包含在 RStudio Conf 2018 期间收集到的推文。由于这个数据集是 JSON 格式,您已经在 R 中将其读取为一个嵌套列表。
首先,您想对这个数据集做一些基础探索,purrr 将大显身手。相关包已为您加载,数据集 rstudioconf 已在您的工作区中可用。
注意:不要尝试打印整个数据集——它太大,无法在 datacamp 控制台完整显示。
请注意,这些都是来自 Twitter 的真实数据,因此可能包含不雅或冒犯性内容(本练习以及后续任何使用真实 Twitter 数据的练习均可能如此)。
本练习是课程的一部分
使用 purrr 的函数式编程进阶
练习说明
打印列表的第一个元素,以便了解其内容与结构。
由于您想聚焦于原创推文(非转推),请使用每个子列表中的逻辑元素
"is_retweet"创建一个"非转推"的子列表。使用适用于整数的
map_*变体,从新子列表的每个元素中提取"favorite_count"元素。计算上一步结果的中位数。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Print the first element of the list to the console
# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")
# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")
# Get the median of favorite_count for non_rt
___(___)